以下の表は、 モデルのリリース の一覧です。 モデルの非推奨 ルールとリストについては、「 モデルの廃止ポリシー 」をご参照ください。
シンガポール
モデルタイプ | 日付 | サービス範囲 | モデル ID | 説明 |
|---|---|---|---|---|
テキスト生成、推論、視覚理解 | 2026-09-02 | インターナショナル |
| Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) is an upgraded snapshot of qwen3.8-max. Coding capability breaks new ground, handling more complex engineering-scale projects and long-horizon autonomous development. Collaborative agent performance is significantly enhanced, with greater composure in multi-tool orchestration and end-to-end task delivery. Native vision understanding is refined across chart reasoning, document parsing, and multimodal perception — sharper and more reliable. Retains the 1M context window, thinking mode, and full tool ecosystem, evolving at a higher level of intelligence. |
テキスト生成、深い思考、視覚理解 | 2026-08-26 | インターナショナル |
| Qwen3.8-Flash は千問3.8シリーズの軽量フラッグシップモデルで、100万トークンのコンテキストウィンドウ、最大128kの出力長、256kの思考バジェットをサポートします。深い推論、Function Calling、構造化出力、組み込みツール、ネイティブ視覚理解に対応し、性能とコストの最適なバランスを実現します。日常的なテキスト生成からエージェントシナリオまで幅広いタスクに適しています。 |
動画生成 | 2026-08-20 | インターナショナル |
| Wan3.0-Video-Prime は、Wan3.0 動画生成モデルの高速バージョンであり、その機能は Wan3.0-Video 標準バージョンに準拠しています。4 モーダル完全参照入力をサポートし、最大 30 秒の動画を生成でき、エンドツーエンドの速度が大幅に向上した没入感のある視聴覚体験を提供します。 |
テキスト生成、推論、視覚理解 | 2026-08-19 | インターナショナル |
| Kimi K3 は、2.8 兆のパラメーターを持つ Kimi の最も強力なフラッグシップモデルです。KDA ハイブリッド線形アテンション (Kimi Delta Attention) および Attention Residuals 技術に基づいて構築されており、ネイティブで視覚理解をサポートし、100 万トークンのコンテキストウィンドウを備えています。これは、ロングコンテキストプログラミング、ナレッジワーク、および高度な推論のために設計された、世界初のオープンソース 3 兆パラメーターモデルです。 |
テキスト生成、推論、視覚理解 | 2026-08-17 | インターナショナル |
| Qwen3.8 シリーズの 27B ネイティブ視覚言語密モデルです。3.6-27B と比較して、テキストおよび視覚モダリティにおけるコーディングおよびオフィスシナリオの能力向上に重点を置いており、複雑なタスクをエンドツーエンドでより確実に完了し、信頼性の高い結果を提供できます。 |
テキスト生成、推論 | 2026-08-17 | インターナショナル |
| GLM-5.3 は、Zhipu のこれまでで最も強力なコーディングモデルであり、内部知覚評価において GLM-5.2 を 50% 上回る改善を遂げています。サイバーセキュリティにおいて、GLM-5.3 はホワイトボックスコードレビューと脆弱性発見で Mythos 5 に匹敵し、サイバーセキュリティ防御シナリオにおける強力な可能性を示しています。 |
テキスト生成、推論 | 2026-08-14 | インターナショナル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ Mixture-of-Experts (MoE) 大規模言語モデルです。ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。広範な高品質データでトレーニングされたこのモデルは、数学的・論理的推論、複雑な推論、プロフェッショナルなコード生成、詳細な長文ドキュメント分析において強力なパフォーマンスを発揮し、先端科学研究、複雑な企業ワークフロー、高度なエージェントアプリケーションなどの要求の厳しいシナリオに適しています。 |
テキスト生成 | 2026-08-12 | インターナショナル |
| Qwen3.8-2.4T-A95B は、2026 年 8 月にリリースされた Qwen の最新フラッグシップシリーズのオープンソースバージョンです。総パラメーター数 2.4 兆、ステップごとに約 950 億がアクティブ化されるスパース MoE アーキテクチャを採用し、ハイブリッドアテンションメカニズムと組み合わせて、100 万トークンのコンテキストをサポートします。主要なベンチマーク:GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1、BabyVision 82.0、CodeArena グローバル #4。 |
リアルタイムチャット | 2026-08-10 | インターナショナル |
| Qwen 3.0 リアルタイム音声モデル Standard Edition - Artificial Analysis Speech-to-Speech ベンチマークで世界第 1 位にランクされた次世代の全二重音声モデルです。モデルのインテリジェンスと全二重対話リズムのバランスを取り、自然なインタラクションと向上した応答品質を実現します。 |
リアルタイムチャット | 2026-08-10 | インターナショナル |
| Qwen 3.0 リアルタイム音声対話モデル Flash Edition - Artificial Analysis Speech-to-Speech ベンチマークで世界第 1 位にランクされた次世代の全二重音声モデルです。高いインテリジェンスと最適化された全二重リズムを組み合わせ、低遅延 (並列推論、完全ストリーミング最適化) で応答速度に重点を置いた「速くて賢い」対話体験を実現します。 |
テキスト生成、推論、視覚理解 | 2026-08-07 | インターナショナル |
| Kimi K3 は、Kimi のこれまでで最も高性能なフラッグシップモデルで、2.8 兆のパラメーターを備え、Kimi Delta Attention (KDA) ハイブリッド線形アテンションメカニズムと Attention Residuals 技術に基づいて構築されています。ネイティブで視覚理解をサポートし、最大 100 万トークンのコンテキストウィンドウを提供します。3 兆パラメーター規模で世界初のオープンソースモデルとして、長期的なプログラミング、ナレッジワーク、推論などの最先端のインテリジェントアプリケーション向けに特別に設計されています。 |
テキスト生成、推論 | 2026-08-07 | インターナショナル |
| Zhipu AI から直接提供。GLM-5.2 は、真に利用可能な 1M コンテキストウィンドウをサポートし、ロングコンテキストタスクにおいてトップの地位を維持しています。 |
動画生成 | 2026-08-06 | インターナショナル |
| Wan3.0 は、参照、編集、複製、駆動などの複数の創造的機能を統一的にサポートするオールインワン動画生成モデルです。4 モーダル完全参照入力、最大 30 秒の動画生成をサポートし、ファイル、Web ページ、複雑な画像を解析できます。プロダクションレベルのキャラクター一貫性とリアルな音声と映像により、没入感のある視聴覚的インパクトを提供します。 |
画像生成 | 2026-08-04 | インターナショナル |
| 明確な命令理解:最大 4.5k トークンの入力をサポートし、複雑な画像テキスト命令を一度に生成します。安定したテキストレンダリング:10px の小さなテキスト、12 言語、20 以上のフォントが鮮明に読み取れ、インフォグラフィックやインターフェイスにすぐに使用できます。便利なバッチ出力:ポスター、Web ページ、インターフェイスなどの日常的なタスクを低コストで一括生成でき、継続的な作成に最適です。Qwen-Image-3.0 Standard は、生成品質だけでなく、日常の創造的な利便性も追求し、画像生成を持続可能なコンテンツ生産性ツールにします。 |
テキスト生成、推論、視覚理解 | 2026-08-02 | インターナショナル |
| 2.4 兆パラメーターの MoE フラッグシップで、コーディングとオフィス能力が包括的に飛躍し、数日間にわたって自律的にコーディングして完全なプロジェクトを提供できます。法律、金融、デザインなどの数百の専門的なタスクを処理し、1 回の対話でエンドツーエンドのプロダクションレベルの結果を提供します。ネイティブの視覚理解は、計画、実行、検証のパイプライン全体を通じて実行され、超長文ドキュメントと長尺動画の深層セマンティック解析をサポートします。長期タスクにおいて自律的計画とクローズドループ反復を実行し、継続的に進化します。 |
テキスト生成、推論 | 2026-08-01 | インターナショナル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト埋め込み | 2026-07-31 | インターナショナル |
| Qwen3-7-Text-Embedding は、Qwen3.7 に基づく多言語テキストベクトルモデルで、text-embedding-v4 に比べてテキスト検索、クラスタリング、分類が大幅に改善されています。MTEB 多言語、中英、コード検索タスクで 20% 優れたパフォーマンスを達成し、カスタマイズ可能なベクトル次元 (256-2560) をサポートします。 |
音声認識 | 2026-07-30 | インターナショナル |
| Qwen-Audio-3.0-ASR-Flash-Streaming (リアルタイム)、Qwen-Audio-3.0-ASR-Flash-Filetrans (非リアルタイム)、および Qwen-Audio-3.0-ASR-Flash (非リアルタイム) モデルを追加しました:方言サポート:7 つの主要な中国語方言グループ (官話、呉語、湘語、贛語、客家語、閩語、粤語) と 20 以上の地域アクセントをサポートします。漢詩の最適化:漢詩の認識精度を向上させ、教育、文化、オーディオブックのシナリオに適しています。テキストの最適化:句読点予測とテキスト正規化を強化し、数字、日付、金額を自動的に標準形式に変換します。多言語拡張:中国語、英語、日本語、韓国語を含む 30 言語をサポートします。ホットワードとコンテキスト:ホットワード (プリコンパイルおよびオンザフライ) とコンテキスト入力をサポートし、ドメイン固有の用語の認識精度を向上させます。 |
テキスト生成、推論、視覚理解 | 2026-07-21 | インターナショナル |
| Qwen3.7 ネイティブ視覚言語シリーズ Flash モデルは、3.6-Flash と比較してマルチモーダル理解とエージェント実行能力を包括的に強化しています。主な改善点には、基礎的なマルチモーダル能力の強化、オブジェクト認識の向上、実世界認識と空間的知性の改善が含まれます。Search Agent や CI Agent などのマルチモーダルエージェントシナリオは大幅にアップグレードされ、より安定したエンドツーエンドのタスク実行が可能になりました。マルチモーダルコーディング能力が最適化され、よりスムーズな Vibe コーディング体験を提供します。 |
画像生成 | 2026-07-20 | インターナショナル |
| 豊富なコンテンツ:最大 4.5k トークンの入力と、画像内画像による高密度な情報レイアウトをサポートし、新聞、絵コンテ、メニュー、試験問題などの複雑なレイアウトを一度に生成できます。 本物のディテール:10px の小さなテキストの正確なレンダリングをサポートし、微細な表情、毛穴、髪の毛一本一本などの細かいディテールを鮮やかに再現し、実際の写真の品質に近づきます。 深い知識:12 言語と 20 以上のフォントのネイティブレンダリング、Web ページ、ゲーム、ライブストリームなどの主流インターフェイスのリアルなシミュレーションをサポートし、外部知識を完全に組み込みます。 Qwen-Image-3.0-Pro は「見栄えの良さ」だけでなく、「実用性」も追求しており、画像生成を真に展開可能な生産性ツールにしています。 |
音声合成、リアルタイム音声合成 | 2026-07-14 | インターナショナル |
| Qwen-Audio-3.0-TTS-Plus は、高品質な音声生成シナリオ向けに設計されたパフォーマンス専有型音声合成モデルです。以前のバージョンと比較して、より多くの低リソース言語と中国語方言をサポートし、方言の信憑性を大幅に向上させ、感情、トーン、キャラクター、話速、音量、合成スタイルをより正確に制御するための自由形式の命令追従と詳細なタグ制御を強化しています。また、ノイズや残響のある音響条件下でもより堅牢になり、音質、明瞭度、解像度、全体的な表現力がさらに向上しています。Plus バージョンは、合成品質と詳細な表現力に重点を置いており、コンテンツ作成、オーディオブック、映画やビデオの吹き替え、ブランド音声デザイン、プレミアム音声サービスなど、音質、自然さ、表現力に対する要求が高いプロフェッショナルなシナリオに適しています。 |
リアルタイム音声合成 | 2026-07-14 | インターナショナル |
| qwen-audio-3.0-tts-flash は、リアルタイムのインタラクティブなシナリオ向けに最適化されたパフォーマンス専有型音声合成モデルです。以前のバージョンと比較して、より多くの低リソース言語と中国語方言をサポートし、方言の信憑性を向上させ、感情、トーン、キャラクター、話速、音量、表現スタイルをより柔軟に制御するための自由形式の命令追従と詳細なタグ制御を強化しています。また、ノイズや残響のある音響条件下でもより堅牢になり、音質、明瞭度、全体的な表現力が向上しています。Flash バージョンはリアルタイム合成に重点を置いており、初回パケットレイテンシは 200 ms 以内に制御されているため、音声アシスタント、リアルタイム対話、インテリジェントカスタマーサービス、その他の低遅延インタラクティブアプリケーションに適しています。 |
テキスト生成 | 2026-07-10 | インターナショナル |
| GLM-5.2-Fast-Preview は、Zhipu AI の GLM-5.2 の高速バリアントで、1M のコンテキストと標準バージョンと同等の機能を備えています。推論最適化により 1.5~2 倍の出力 TPS を実現し、リアルタイムチャット、マルチターンエージェント、ストリーミングコード生成などの遅延の影響を受けやすいユースケースに適しています。 |
動画生成 | 2026-07-01 | インターナショナル |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。このバージョンは 2026 年 6 月 12 日時点のスナップショットです。 |
動画生成 | 2026-07-01 | インターナショナル |
| Wan2.7 参照動画生成、一貫性とパフォーマンスが向上しました。キャラクター、小道具、シーンの優れた安定性を提供します。最大 5 つの混合画像/動画入力のハイブリッド参照と音声の音色のクローンをサポートします。コアエンジンのアップグレードと合わせて、前例のない映画的な表現力を実現します。このバージョンは 2026 年 6 月 12 日時点のスナップショットです。 |
画像生成 | 2026-06-25 | インターナショナル |
| Qwen-Image-2.0 シリーズのフル機能モデルは、画像生成と編集を統合しています。1k トークンのコマンドサポートによるよりプロフェッショナルなテキストレンダリング機能、より繊細でリアルなテクスチャ、リアルなシーンの細やかな描写、そしてより強力なセマンティックな追従性を誇ります。フル機能バージョンは、2.0 シリーズで最も強力なテキストレンダリング機能とリアルなテクスチャを備えています。 |
テキスト生成、推論、視覚理解 | 2026-06-25 | インターナショナル |
| kimi-k2.7-code は、Kimi のこれまでで最もインテリジェントなコーディングモデルです。ロングコンテキストでより確実に命令に従い、より高い成功率でプログラミングタスクを完了します。テキスト、画像、動画の入力をサポートし、思考モード、会話、エージェントタスクにも対応しています。 |
テキスト生成、推論 | 2026-06-25 | インターナショナル |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
音声認識 | 2026-06-17 | インターナショナル |
| 2026 年 6 月に更新された Bailing ASR バージョンは、繁体字中国語の 7 大方言 (官話/呉語/湘語/贛語/客家語/閩語/粤語) を完全にサポートし、20 種類以上の地域官話アクセントに対応しています。漢詩のリズム、韻律、文学的表現の特徴に特化した最適化が施されており、詩の認識精度を向上させ、文化遺産、教育解説、オーディオブックに適しています。句読点予測とテキスト正規化能力が向上し、出力テキストが書き言葉の表現習慣により一致するようになりました。数字、日付、金額は自動的に標準形式に変換され、読みやすさと専門性が向上します。言語サポートは、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語の合計 30 言語に拡張されました。コンテキスト化機能をサポートし、最大 5 分間の音声を書き起こすことができます。 |
動画生成 | 2026-06-16 | インターナショナル |
| HappyHorse-1.1-T2V は、セマンティック理解、映画的なショットコントロール、ダイナミックなモーションレンダリングが向上した Text-to-Video 生成をサポートします。創造的な意図をより正確に捉え、より滑らかな動き、豊かなディテール、強力な視覚的一貫性、そしてより自然なキャラクターのアクション、シーンの雰囲気、物理的なダイナミクスを持つ高品質な動画を生成します。 |
動画生成 | 2026-06-16 | インターナショナル |
| HappyHorse-1.1-R2V は、被写体、シーンスタイル、視覚的一貫性の安定性が大幅に向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像をサポートし、創造的な意図をより正確に理解して保持し、キャラクター、シーン、スタイル、映画的な動き全体でより強力な制御性と表現力を提供します。 |
動画生成 | 2026-06-16 | インターナショナル |
| HappyHorse-1.1-I2V は、視覚品質、動的パフォーマンス、クリップ間の一貫性が向上した Image-to-Video 生成をサポートします。入力画像をより正確に理解し、創造的な意図を保持することで、肌の質感のリアリズム、クリップ間のキャラクター ID の一貫性、動きの滑らかさ、テキストレンダリングの安定性、視聴覚同期が大幅に改善され、より高いリアリズム、豊かなディテール、強力な全体的一貫性を持つ高品質な動画を生成します。 |
テキスト生成、推論、視覚理解 | 2026-06-10 | インターナショナル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、5 月 20 日のスナップショットと比較して視覚モーダル理解が追加され、実世界のシーンを認識し、マルチモーダル対話型ハイブリッドエージェント機能をサポートします。このバージョンは 2026 年 6 月 8 日に取得されたスナップショットに基づいています。 |
テキスト生成、推論、視覚理解 | 2026-06-01 | インターナショナル |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
テキスト生成、推論 | 2026-05-21 | インターナショナル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
テキスト生成、推論 | 2026-05-20 | インターナショナル |
| Qwen3.7 シリーズで最大かつ最も高性能なバリアントである Max モデルは、プレビューとして利用可能で、思考モードのみをサポートし、実験用に純粋なテキストのみのインターフェイスを提供します。主に、知識ベースの質疑応答、命令追従、創造的なライティングなどの汎用的な対話ユースケースに最適化されています。 |
リアルタイム音声翻訳 | 2026-05-19 | インターナショナル |
| 高精度、高応答性、堅牢な多言語対応の音声・映像同時通訳モデルである Qwen3.5-LiveTranslate-Flash のリアルタイムバージョンです。Qwen3.5-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3.5-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。60 以上の言語を理解し、29 の言語を話すことができます。 |
テキスト生成、推論 | 2026-05-11 | インターナショナル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ MoE 大規模モデルで、ネイティブで最大 100 万トークンのコンテキスト長をサポートします。膨大な高品質データコーパスでトレーニングされており、高度な数学的推論、複雑な論理的推論、専門的なコーディング、長文テキストの詳細な分析に優れており、最先端の研究、洗練されたオフィスワークフロー、高度な AI エージェントなどの要求の厳しいアプリケーションに適しています。 |
テキスト生成、推論 | 2026-05-11 | インターナショナル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
動画生成 | 2026-04-26 | インターナショナル |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。このバージョンは 2026 年 4 月 25 日時点のスナップショットです。 |
動画生成 | 2026-04-26 | インターナショナル |
| Wan2.7 画像動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。このバージョンは 2026 年 4 月 25 日時点のスナップショットです。 |
動画生成 | 2026-04-26 | インターナショナル |
| HappyHorse-1.0-V2V は、自然言語の命令による高度なビデオ編集をサポートします。最大 5 枚の参照画像を使用してビデオ要素の局所的または全体的な編集を可能にし、元の動きのダイナミクスを正確に保持して優れた表現力を実現します。 |
動画生成 | 2026-04-26 | インターナショナル |
| HappyHorse-1.0-R2V は、被写体とシーンの参照における安定性が向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像を処理でき、創造的な意図を正確に保持して優れたパフォーマンスを提供します。 |
テキスト生成、推論、視覚理解 | 2026-04-23 | インターナショナル |
| Qwen3.5 ネイティブ視覚言語シリーズ Plus モデルは、2 月 15 日のスナップショットと比較して、エージェントコーディング能力が大幅に向上しています。推論速度も大幅に向上しており、知識保持、推論能力、ロングコンテキスト処理は高いレベルを維持しているため、複雑なエージェントベースのタスクに適しています。コーディングエージェント、生産ワークフロー、高スループットシナリオなどのアプリケーションに最適です。このバージョンは 2026 年 4 月 20 日に取得されたスナップショットに基づいています。 |
画像生成 | 2026-04-23 | インターナショナル |
| フル機能の Qwen-Image-2.0 シリーズモデルは、画像生成と画像編集を統合し、1,000 トークンのプロンプトをサポートする強化されたテキストレンダリング、より洗練されたリアルなテクスチャ、フォトリアリスティックなシーンの詳細な描写、より強力なセマンティックな追従性を提供します。フル機能バージョンは、2.0 シリーズで最も強力なテキストレンダリングと最もリアルなテクスチャを提供します。 |
テキスト生成、推論、視覚理解 | 2026-04-22 | インターナショナル |
| Qwen3.6 27B ネイティブ視覚言語密モデルは、3.5-27B バージョンを基盤としており、エージェントコーディング能力と強化された STEM 推論および推論スキルが主な改善点です。視覚モダリティでは、空間的知性、オブジェクトローカライゼーション、検出において著しい進歩を示しており、動画理解、ドキュメント OCR、視覚エージェント能力も着実に向上しています。 |
動画生成 | 2026-04-22 | インターナショナル |
| HappyHorse-1.0-T2V は、非常にリアルな動的レンダリングを特徴とするテキスト動画生成をサポートします。テキストのセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
動画生成 | 2026-04-22 | インターナショナル |
| HappyHorse-1.0-I2V は、非常にリアルな動的レンダリングを特徴とする画像動画生成を可能にします。テキストと画像の両方のセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | インターナショナル |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | インターナショナル |
| Qwen3.6 35B-A3B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートフレームワークを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3.5-35B-A3B と比較して、このモデルはエージェントコーディング能力、数学的およびコード推論能力、空間的知性、ならびにオブジェクトローカライゼーションおよびオブジェクト検出パフォーマンスが大幅に向上しています。 |
音声合成 | 2026-04-15 | インターナショナル |
| Cosyvoice-v3 と連携して使用される大規模モデル音声複製サービスです。高度な大規模モデル技術を特徴抽出に利用し、トレーニングプロセスなしで音声を複製できます。非常に短い音声クリップだけで、非常に類似した自然な響きのカスタム音声を迅速に生成できます。 |
テキスト生成、推論 | 2026-04-14 | インターナショナル |
| Qwen3.6 シリーズで最大かつ最も高性能なバリアントである Max モデルが、プレビューバージョンとして利用可能になりました。現在、実験用に公開されているのはプレーンテキスト機能のみです。以前にリリースされた Qwen3-Max および Qwen3.6-Plus と比較して、このモデルは Vibe コーディング能力が向上し、コーディングエージェントの実行がより効率的になり、フロントエンド開発スキルが大幅に向上しています。さらに、ロングテール知識の保持もさらにアップグレードされています。 |
テキスト生成、推論 | 2026-04-14 | インターナショナル |
| GLM-5.1 は、Zhipu AI によって開発されたモデルで、長期タスク向けに特別に設計されています。7,440 億のパラメーターを持ち、20 万トークンの超長コンテキストをサポートし、1 回の応答で最大 12 万 8,000 トークンを生成できます。GLM-5.1 は、論理的推論、長文理解、コード生成に優れており、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れた結果を出し、インテリジェントなヒューマンコンピュータインタラクション、エンタープライズソリューション、開発者支援などのアプリケーションに適しています。 |
動画生成 | 2026-04-03 | インターナショナル |
| Wan2.7 動画編集は、プロンプトによる局所的および全体的な編集の両方をサポートします。画像参照を使用して要素をシームレスに置き換え、動き、特殊効果、カメラワークなどの複雑な動的プロセスを複製します。 |
動画生成 | 2026-04-03 | インターナショナル |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。 |
動画生成 | 2026-04-03 | インターナショナル |
| Wan2.7 参照動画生成、一貫性とパフォーマンスが向上しました。キャラクター、小道具、シーンの優れた安定性を提供します。最大 5 つの混合画像/動画入力のハイブリッド参照と音声の音色のクローンをサポートします。コアエンジンのアップグレードと合わせて、前例のない映画的な表現力を実現します。 |
動画生成 | 2026-04-03 | インターナショナル |
| Wan2.7 画像動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。 |
画像生成 | 2026-04-01 | インターナショナル |
| Wan2.7–image-pro は、テキストから画像、テキスト/画像から連続画像、画像編集、複数画像参照生成、インタラクティブ編集をサポートします。テキストレンダリング、被写体の一貫性、複雑な命令追従において強化されたパフォーマンスを提供します。 |
画像生成 | 2026-04-01 | インターナショナル |
| Wan2.7 – 画像生成および編集は、テキストから画像、テキスト/画像から連続画像、画像編集、複数画像参照生成、インタラクティブ編集をサポートします。テキストレンダリング、被写体の一貫性、複雑な命令追従において強化されたパフォーマンスを提供します。 |
テキスト生成、推論、視覚理解 | 2026-04-01 | インターナショナル |
| Qwen3.6 ネイティブ視覚言語 Plus シリーズモデルは、現在の最先端モデルに匹敵する卓越したパフォーマンスを示し、3.5 シリーズと比較して全体的な結果が大幅に向上しています。このモデルは、エージェントコーディング、フロントエンドプログラミング、Vibe コーディングなどのコード関連能力、およびマルチモーダル一般オブジェクト認識、OCR、オブジェクトローカライゼーションにおいて著しく強化されています。 |
リアルタイムオムニモーダル | 2026-03-26 | インターナショナル |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen3-Omni の完全進化版として、60 以上の言語の音声入力、30 以上の言語の音声出力、制御可能な音声対話、Web 検索、複雑な FunctionCall 呼び出しをサポートし、インテリジェントなセマンティック割り込みインタラクション能力を備えています。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクティブ体験を提供します。 |
オムニモーダル | 2026-03-26 | インターナショナル |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen 3-Omni の包括的な進化版として、10 時間以上の音声理解と 400 秒以上の 720P (1 FPS) 視聴覚理解と対話をサポートします。言語範囲をさらに拡大し、60 以上の言語の音声入力と 30 以上の言語の音声出力をサポートします。また、強力な構造化視聴覚理解能力も備えており、テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然で流暢なマルチモーダル理解とインタラクティブ体験を提供します。 |
リアルタイムオムニモーダル | 2026-03-26 | インターナショナル |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen3-Omni の完全進化版として、60 以上の言語の音声入力、30 以上の言語の音声出力、制御可能な音声対話、Web 検索、複雑な FunctionCall 呼び出しをサポートし、インテリジェントなセマンティック割り込みインタラクション能力を備えています。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクティブ体験を提供します。 |
オムニモーダル | 2026-03-26 | インターナショナル |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen 3-Omni の包括的な進化版として、10 時間以上の音声理解と 400 秒以上の 720P (1 FPS) 視聴覚理解と対話をサポートします。言語範囲をさらに拡大し、60 以上の言語の音声入力と 30 以上の言語の音声出力をサポートします。また、強力な構造化視聴覚理解能力も備えており、テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然で流暢なマルチモーダル理解とインタラクティブ体験を提供します。 |
リアルタイムオムニモーダル | 2026-03-25 | インターナショナル |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen3-Omni の完全進化版として、60 以上の言語の音声入力、30 以上の言語の音声出力、制御可能な音声対話、Web 検索、複雑な FunctionCall 呼び出しをサポートし、インテリジェントなセマンティック割り込みインタラクション能力を備えています。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクティブ体験を提供します。このバージョンは 2026 年 3 月 15 日のスナップショットです。 |
テキスト生成、推論 | 2026-03-20 | インターナショナル |
| DeepSeek-V3.2 は、スパースアテンションメカニズムである DeepSeek Sparse Attention を組み込んだモデルの公式リリースです。また、DeepSeek が推論をツール使用に統合した最初のモデルでもあり、推論対応と非推論の両方のツール呼び出しをサポートします。 |
画像生成 | 2026-03-03 | インターナショナル |
| フル機能の Qwen-Image-2.0 シリーズモデルは、画像生成と画像編集を統合し、1,000 トークンのプロンプトをサポートする強化されたテキストレンダリング、より洗練されたリアルなテクスチャ、フォトリアリスティックなシーンの詳細な描写、より強力なセマンティックな追従性を提供します。フル機能バージョンは、2.0 シリーズで最も強力なテキストレンダリングと最もリアルなテクスチャを提供します。このバージョンは 2026 年 3 月 3 日時点のスナップショットです。 |
画像生成 | 2026-03-03 | インターナショナル |
| Qwen-Image-2.0 シリーズの高速化モデルは、画像生成と画像編集を統合し、1,000 トークンのプロンプトをサポートする強化されたテキストレンダリング機能、よりリアルなテクスチャ、細かく詳細なフォトリアリスティックなシーン、改善されたセマンティックな一貫性を提供します。高速化バージョンは、モデルのパフォーマンスと品質の最適なバランスを効果的に実現します。 |
音声認識 | 2026-03-02 | インターナショナル |
| Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現し、言語を自動的に判断し、複数の言語の音声を正確に識別しながら、複雑な音声環境でも正確な書き起こしを保証します。このバージョンは 2026 年 2 月 10 日付のスナップショットです。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | インターナショナル |
| Qwen3.5 ネイティブ視覚言語 Flash モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルタスクの両方でパフォーマンスが飛躍的に向上し、推論速度と全体的なパフォーマンスのバランスを取りながら高速な応答時間を提供します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | インターナショナル |
| Qwen3.5 シリーズ 35B-A3B は、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャで設計されたネイティブ視覚言語モデルで、より高い推論効率を実現しています。その全体的なパフォーマンスは Qwen3.5-27B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | インターナショナル |
| Qwen3.5 27B ネイティブ視覚言語密モデルは、線形アテンションメカニズムを組み込んでおり、推論速度とパフォーマンスのバランスを取りながら高速な応答時間を提供します。その全体的な能力は Qwen3.5-122B-A10B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | インターナショナル |
| Qwen3.5 122B-A10B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。全体的なパフォーマンスの観点から、このモデルは Qwen3.5-397B-A17B に次ぐものです。そのテキスト能力は Qwen3-235B-2507 を大幅に上回り、視覚能力は Qwen3-VL-235B を超えています。 |
テキスト生成 | 2026-02-20 | インターナショナル |
| Qwen3 シリーズの新世代コード生成モデルは、Qwen3-Coder-Plus に近いパフォーマンスを提供しながら、さらに優れた機能を提供します。このモデルは、リポジトリレベルの理解に重点を置いて最適化されており、マルチターンのツールインタラクションをサポートし、エージェントコーディングツールとの互換性を強化しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 | インターナショナル |
| Qwen3.5 ネイティブ視覚言語シリーズ Plus モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。さまざまなタスク評価において、3.5 シリーズは一貫して最先端の主要モデルと同等のパフォーマンスを示しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルの両方の能力で飛躍的な進歩を示しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 | インターナショナル |
| Qwen3.5 シリーズ 397B-A17B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。言語理解、論理的推論、コード生成、エージェントベースのタスク、画像理解、動画理解、グラフィカルユーザーインターフェイス (GUI) インタラクションなど、幅広いタスクで最先端のモデルに匹敵する最先端のパフォーマンスを提供します。堅牢なコード生成とエージェント能力により、このモデルは多様なエージェントで強力な汎化能力を示します。 |
音声認識 | 2026-02-13 | インターナショナル |
| Qwen3-ASR-Flash のリアルタイムバージョンは、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現し、言語を自動的に判断し、複数の言語の音声を正確に識別しながら、複雑な音声環境でも正確な書き起こしを保証します。このバージョンは 2026 年 2 月 10 日付のスナップショットです。 |
音声合成 | 2026-02-10 | インターナショナル |
| Qwen3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスによって設計された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 26 日のスナップショットバージョンです。 |
音声合成 | 2026-02-10 | インターナショナル |
| Qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen-voice-enrollment サービスから複製された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声の音色を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 22 日のスナップショットバージョンです。 |
音声合成 | 2026-02-10 | インターナショナル |
| Qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。Instruct モデルは自然言語を通じて合成効果を処理し、さまざまなコンテキストで非常に適切な感情的で表現力豊かな音声を保証します。現在、中国語と英語の両方の Instruct 調整用に 25 の音色をサポートしています。 |
音声合成 | 2026-02-10 | インターナショナル |
| クローン能力:CosyVoice-v3-plus は、Tongyi Lab の CosyVoice シリーズの最新の大規模音声クローニングモデルです。優れた音質とクローニング忠実度を提供し、プロフェッショナルなシナリオに最適です。わずか 5~20 秒の参照音声で、非常に類似した自然な響きのカスタム音声を迅速に生成できます。合成能力:CosyVoice-v3-plus は、Tongyi Lab の CosyVoice シリーズの最新の大規模音声合成モデルです。音質と表現力が向上しており、プロフェッショナルなシナリオに最適です。このモデルは、リアルタイムのストリーミング音声合成をサポートしています。 |
音声合成 | 2026-02-09 | インターナショナル |
| 合成能力:CosyVoice-v3-Flash は、Tongyi Labs の CosyVoice シリーズの最新のパフォーマンス専有型音声合成モデルで、以前のバージョンと比較して自然さ、音色、韻律、感情表現が向上しています。このモデルは、リアルタイムのストリーミング音声合成をサポートしています。クローン能力:CosyVoice-v3-Flash は、Tongyi Labs の CosyVoice シリーズの最新の音声クローニングモデルでもあります。以前のバージョンと比較して、発音の精度と音色の類似性が向上し、あまり話されていない言語 (ドイツ語、スペイン語、フランス語、イタリア語、ロシア語、日本語) のサポートが追加されています。わずか 5~20 秒の参照音声から、非常に類似した自然な響きのカスタム音声を迅速に生成できます。 |
テキスト生成 | 2026-01-30 | インターナショナル |
| Qwen シリーズのロールプレイングモデルです。これは動的に更新されるバージョンであり、モデルの更新については事前に通知が提供されます。擬人化ロールプレイングに適しており、事前定義されたキャラクターの指示に従う、会話を進める、積極的な傾聴と共感を示す能力が最適化されています。さらに、パーソナライズされたキャラクターの深い復元をサポートします。 |
動画生成 | 2026-01-29 | インターナショナル |
| Wan2.6 参照動画生成フラッシュ、より速く、よりコスト効率の高い生成。指定された人物または任意のオブジェクトをリファレンスとして使用することをサポートし、外観と声の一貫性を正確に維持し、共同パフォーマンスのための複数キャラクター参照を可能にします。 |
テキスト埋め込み | 2026-01-27 | インターナショナル |
| Qwen LLM 基盤でトレーニングされたテキストランキングモデルは、入力クエリと候補ドキュメントの関連性ランキングを実行します。100 以上の言語と長文入力をサポートし、テキスト検索や RAG などのアプリケーションに適しています。そのパフォーマンスは、オープンソースの Qwen3-Rerank シリーズモデルに準拠しています。 |
テキスト生成、推論 | 2026-01-23 | インターナショナル |
| 2025 年 9 月 23 日時点のスナップショットと比較して、このリリースの Qwen-3 シリーズ Max モデルは、思考モードと非思考モードの効果的な統合を実現し、モデルの全体的なパフォーマンスが包括的かつ大幅に向上しています。思考モードでは、モデルは Web 検索、Web 情報抽出、コードインタープリターツールを同時にサポートし、遅く慎重な推論を行いながら外部ツールを活用することで、より複雑で困難な問題をより高い精度で解決できます。このバージョンは 2026 年 1 月 23 日に取得されたスナップショットに基づいています。 |
視覚理解 | 2026-01-22 | インターナショナル |
| Qwen3 シリーズの small サイズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。2025 年 10 月 15 日に取得されたスナップショットと比較して、モデルの全体的なパフォーマンスは大幅に向上しています。一般的な視覚認識と推論の能力が向上し、セキュリティ、店舗内検査、機器モニタリング、写真ベースの問題解決などのさまざまなビジネスシナリオでの認識精度が著しく向上しています。このバージョンは 2026 年 1 月 22 日時点のスナップショットです。 |
音声合成 | 2026-01-21 | インターナショナル |
| qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。Instruct モデルは自然言語を通じて合成効果を処理し、さまざまなコンテキストで非常に適切な感情的で表現力豊かな音声を保証します。現在、中国語と英語の両方の Instruct 調整用に 25 の音色をサポートしています。このモデルは 2026 年 1 月 22 日にリリースされたスナップショットバージョンと同等です。 |
動画生成 | 2026-01-15 | インターナショナル |
| Wan2.6 画像動画生成フラッシュ、より速く、よりコスト効率の高い生成。インテリジェントなショットスケジューリングにより、マルチカメラストーリーテリングが可能になり、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
画像生成 | 2026-01-15 | インターナショナル |
| Max シリーズ Qwen の画像編集モデルは、より安定した多機能な編集機能を提供します。工業デザインと幾何学的推論の強化、キャラクターの一貫性の向上、オフセット問題の軽減、そしてより広範な画像編集機能のための LoRA 機能の統合が含まれます。 |
音声合成 | 2026-01-14 | インターナショナル |
| Qwen3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスによって設計された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 15 日のスナップショットバージョンです。 |
音声合成 | 2026-01-14 | インターナショナル |
| Qwen 3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen-voice-enrollment サービスから複製された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 15 日のスナップショットバージョンです。 |
テキスト生成 | 2026-01-13 | インターナショナル |
| Qwen ロールプレイングモデルシリーズは、多言語の擬人化対話シナリオに特化して最適化されています。キャラクターの一貫性維持、コンテキストを意識した対話の進行、共感的な関与において高度な能力を発揮し、正確なパーソナライズされたキャラクターの具現化を可能にします。このバージョンは、日本語の言語ローカライゼーション (方言や敬語を含む)、人間らしいロールプレイングの信憑性、物語の一貫性制御、シナリオベースの認知インテリジェンスを大幅に強化しています。 |
画像生成 | 2026-01-09 | インターナショナル |
| Qwen シリーズの画像生成モデルは、卓越したテキストレンダリング能力を誇り、複雑なテキストレンダリングだけでなく、幅広い生成および編集タスクにも優れています。2026 年 1 月 9 日に取得されたこのバージョンのスナップショットは、Qwen-Image-Max の蒸留・高速化されたバリアントであり、高品質な画像のより高速な生成を可能にします。 |
画像生成 | 2025-12-30 | インターナショナル |
| qwen の画像生成モデルの Max シリーズは、幅広い生成タスクで優れています。Plus シリーズと比較して、生成された画像の「AI らしさ」を大幅に低減し、リアリズムを向上させています。人物の被写体に対してよりリアルな素材の質感、より細かく詳細な自然なテクスチャ、そしてより視覚的に魅力的なテキストレンダリングを提供します。 |
画像生成 | 2025-12-22 | インターナショナル |
| Z-Image-Turbo は、Artificial Analysis ベンチマークで世界 No.1 のオープンソース Text-to-Image モデルとしてトップに立った、非常に効率的な画像生成モデルです。わずか 60 億のパラメーターと 8 ステップの推論プロセスで、大規模な商用モデルによって生成される画像に匹敵するフォトリアリスティックな画像を生成し、中国語と英語のバイリンガルテキストレンダリング、複雑なセマンティック理解、多様なテーマ生成に優れています。 |
推論、視覚理解 | 2025-12-18 | インターナショナル |
| Qwen3 シリーズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。9 月 23 日にリリースされたスナップショットと比較して、このバージョンは推論および分析タスク、スタイル制御において優れたパフォーマンスを提供し、同時により低いレイテンシと高速な応答速度を提供します。このバージョンは 2025 年 12 月 19 日に取得されたスナップショットに基づいています。 |
動画生成 | 2025-12-16 | インターナショナル |
| Wan2.6 参照動画生成は、指定された人物または任意のオブジェクトをリファレンスとして使用することをサポートし、外観と声の一貫性を正確に維持し、共同パフォーマンスのための複数キャラクター参照を可能にします。 |
画像生成 | 2025-12-15 | インターナショナル |
| Wan2.6 Text-to-Image、アップグレードされた視覚品質、美学、命令追従により、正確なスタイル制御、リアルなポートレート、長文理解、広範な歴史的/文化的 IP のカバレッジを提供し、高品質で表現力豊かな視覚生成を可能にします。 |
画像生成 | 2025-12-15 | インターナショナル |
| Wan2.6 Image は、テキストと画像の共同推論、複数画像の創造的融合、商用レベルの一貫性、美的スタイル変換、フレーミングとライティングの正確な制御をサポートするオールラウンドな画像生成モデルで、画像生成における一貫性、制御性、表現力を大幅に向上させます。 |
画像生成 | 2025-12-15 | インターナショナル |
| Qianwen シリーズの Image Editing Plus モデルは、10 月 30 日のスナップショットと比較して、キャラクターの一貫性、工業デザイン能力、幾何学的推論能力が強化されています。さらに、照明効果などの LoRA 機能を統合し、オフセット問題を効果的に軽減します。このバージョンは 2025 年 12 月 15 日に取得されたスナップショットに基づいています。 |
音声合成 | 2025-12-12 | インターナショナル |
| Qwen 3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスによって設計された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2025 年 12 月 16 日のスナップショットバージョンです。 |
音声合成 | 2025-12-12 | インターナショナル |
| Qwen Voice-Design モデルは、Qwen Speech Model の音声デザインモデルシリーズです。簡単なテキスト記述だけで、適切な音声を迅速にデザインできます。qwen3-tts-vd-realtime モデルと組み合わせて使用すると、10 言語で音声をデザインして出力できます。さらに、合成された音声はテキストに基づいてトーンを適応的に調整し、複雑なテキスト合成に対して優れた処理能力を備えています。 |
リアルタイムオムニモーダル | 2025-12-04 | インターナショナル |
| Qwen3-Omni-Flash マルチモーダル大規模モデルのリアルタイムバージョンは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。 |
オムニモーダル | 2025-12-04 | インターナショナル |
| Qwen3-Omni-Flash マルチモーダル大規模モデルは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。 |
リアルタイム音声認識 | 2025-12-04 | インターナショナル |
| Qwen3-LiveTranslate-Flash は、高精度、高応答性、堅牢な多言語リアルタイム音声・映像通訳モデルです。Qwen3-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。19 の言語を理解し、10 の言語を話すことができ、8 つの中国語方言もサポートしています。 |
動画生成 | 2025-12-03 | インターナショナル |
| Wan2.6 テキスト動画生成、インテリジェントなショットスケジューリングはマルチショットストーリーテリングをサポートし、一貫した被写体、シーン、雰囲気を持つマルチショットの物語動画を生成し、最大持続時間は 15 秒です。より良い命令追従と改善された視覚的忠実度を提供します。 |
動画生成 | 2025-12-03 | インターナショナル |
| Wan2.6 画像動画生成、インテリジェントなショットスケジューリングによりマルチカメラストーリーテリングが可能になり、より高品質な音声生成を提供し、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
— | 2025-12-01 | インターナショナル |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
音声合成 | 2025-11-27 | インターナショナル |
| Qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-enrollment サービスによって複製された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声の音色で 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整でき、複雑なテキスト合成に対する優れた処理能力も備えています。このモデルはスナップショットバージョンとして提供されます。 |
音声合成 | 2025-11-27 | インターナショナル |
| Qwen3-TTS-Flash-Realtime モデルは、Tongyi の最新のリアルタイム音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を実現します。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。広範なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自律的に調整し、複雑なコンテンツ合成に対して堅牢な能力を発揮します。 |
音声合成 | 2025-11-27 | インターナショナル |
| Qwen3-TTS-Flash は、Tongyi の最新のオフライン音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を可能にします。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。大規模なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自動的に調整し、複雑なコンテンツの合成に対して堅牢な能力を発揮します。 |
音声合成 | 2025-11-27 | インターナショナル |
| Qwen Voice-Enrollment モデルは、qwen 音声モデルの音声複製モデルシリーズです。わずか 5 秒以上の音声を使用して、非常に類似した音声を迅速に複製できます。qwen3-tts-vc-realtime モデルと組み合わせて使用すると、人の声を高忠実度で複製し、10 言語で音声を出力できます。さらに、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対して優れた処理能力を備えています。 |
視覚理解 | 2025-11-21 | インターナショナル |
| このモデルは 2025 年 11 月 20 日のスナップショットバージョンであり、最新の Qwen-VL3 アーキテクチャに基づいて包括的にアップグレードされています。ドキュメント解析とテキストローカライゼーション能力が大幅に向上し、エンドツーエンドのレイテンシと幻覚が大幅に削減されています。 |
音声認識 | 2025-11-21 | インターナショナル |
| 2026 年 4 月に更新された Fun ASR バージョンは、繁体字中国語の 7 大方言 (官話/呉語/湘語/贛語/客家語/閩語/粤語) を完全にサポートし、20 種類以上の地域官話アクセントに対応しています。漢詩のリズム、韻律、文学的表現の特徴に特化した最適化が施されており、詩の認識精度を向上させ、文化遺産、教育解説、オーディオブックに適しています。句読点予測とテキスト正規化能力が向上し、出力テキストが書き言葉の表現習慣により一致するようになりました。数字、日付、金額は自動的に標準形式に変換され、読みやすさと専門性が向上します。言語サポートは、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語の合計 30 言語に拡張されました。これは 2025 年 11 月 7 日にリリースされたスナップショットです。 |
視覚理解 | 2025-11-20 | インターナショナル |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
テキスト生成 | 2025-11-19 | インターナショナル |
| Qwen-MT-Lite は、多言語翻訳に特化した Qwen モデルシリーズの大規模言語モデルです。32 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格で提供します。用語介入、フォーマット保持、ドメイン固有の翻訳などの機能を提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
音声認識 | 2025-11-18 | インターナショナル |
| Qwen3-ASR-Flash の大容量ファイル書き起こしバージョンです。Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現します。言語を自動的に判断し、複数の言語の音声を正確に認識でき、複雑な音声環境でも正確な書き起こしを保証します。 |
リアルタイム音声認識 | 2025-11-17 | インターナショナル |
| これは、Tongyi Lab の次世代エンドツーエンド音声認識モデルのリアルタイムバージョンで、独自の優れた音声技術に基づいており、卓越したコンテキスト認識と高精度の音声書き起こし機能を誇ります。エンドツーエンドアーキテクチャに基づき、Fun-ASR は革新的な RAG 技術を統合し、大規模なホットワードのカスタマイズ、禁止用語やモーダルパーティクルの自動フィルタリング、ITN 正規化、句読点予測などの多次元機能をサポートし、全体的な認識精度とコンテキストの関連性を大幅に向上させます。さらに、Fun-ASR は中国語と英語の柔軟な切り替えをサポートし、複数の地域の方言をカバーし、耐ノイズ性が強化されており、多様で複雑な環境に適応します。これは 2025 年 11 月 7 日にリリースされたスナップショットです。 |
テキスト生成 | 2025-11-11 | インターナショナル |
| Qwen シリーズの大規模言語モデルである Qwen-MT-Flash は、Qwen 3 アーキテクチャで完全にアップグレードされ、パフォーマンスと翻訳品質が大幅に向上しました。92 の言語で迅速かつコスト効率の高い翻訳を提供し、用語介入、フォーマット保持、ドメイン固有の適応などの高度な機能をサポートします。速度、品質、コストの強力なバランスを必要とするアプリケーションに最適な選択肢です。 |
動画生成 | 2025-11-10 | インターナショナル |
| wan2.2-animate-move は、キャラクターアニメーション生成モデルです。ユーザーはキャラクターの写真と参照パフォーマンスビデオをアップロードするだけで、モデルはビデオから表情とアクションを画像内のキャラクターに転送し、高忠実度のアニメーションビデオを生成します。 |
動画生成 | 2025-11-10 | インターナショナル |
| wan2.2-animate-mix は、キャラクター置換モデル製品です。キャラクターの写真とパフォーマンスビデオをアップロードすることで、ユーザーは元のビデオのキャラクターを写真のキャラクターに正確に置き換えることができ、元のビデオのシーン、照明、色調などの環境の詳細を完全に保持します。 |
マルチモーダル埋め込み | 2025-10-31 | インターナショナル |
| Embedding-Vision は、LLM を搭載した視覚中心のマルチモーダル埋め込みモデルで、さまざまなドメイン (e コマース、フォトギャラリー、セキュリティ、自動運転など) で優れたドメイン特化のパフォーマンスと高いコスト効率を特徴としています。テキスト、画像、ビデオをサポートし、テキストから画像、画像から画像、テキストからビデオ、ビデオからビデオなどの下流の検索タスクに適用できます。 |
マルチモーダル埋め込み | 2025-10-31 | インターナショナル |
| Embedding-Vision は、LLM を搭載した視覚中心のマルチモーダル埋め込みモデルで、さまざまなドメイン (e コマース、フォトギャラリー、セキュリティ、自動運転など) で優れたドメイン特化のパフォーマンスと高いコスト効率を特徴としています。テキスト、画像、ビデオをサポートし、テキストから画像、画像から画像、テキストからビデオ、ビデオからビデオなどの下流の検索タスクに適用できます。 |
画像生成 | 2025-10-31 | インターナショナル |
| qwen シリーズの画像編集 Plus モデルは、初期の Edit モデルに基づいて推論パフォーマンスとシステム安定性をさらに最適化し、画像生成と編集の応答時間を大幅に短縮します。また、1 回のリクエストで複数の画像を返すことをサポートし、ユーザーエクスペリエンスを大幅に向上させます。 |
リアルタイム音声認識 | 2025-10-29 | インターナショナル |
| Qwen3-ASR-Flash のリアルタイムバージョンは、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現し、言語を自動的に判断し、11 の言語の音声を正確に識別しながら、複雑な音声環境でも正確な書き起こしを保証します。 |
推論、視覚理解 | 2025-10-21 | インターナショナル |
| Qwen3-VL シリーズで最大の密モデルであり、その推論バージョンは Qwen3-VL-235B-Thinking に次ぐマルチモーダル推論能力を誇ります。STEM と数学の問題解決、一般的な画像および動画理解に優れ、マルチモーダルエージェント能力で最先端のパフォーマンスを達成しており、複雑なマルチモーダル推論タスクに最適です。 |
視覚理解 | 2025-10-21 | インターナショナル |
| Qwen3-VL シリーズで最大の密モデルであり、非推論バージョンでは、Qwen3-VL-235B-Instruct に次ぐ全体的なパフォーマンスを提供します。ドキュメント認識と理解に優れ、強力な空間認識とオブジェクト識別能力を示し、2D 視覚検出と空間的推論で最先端のパフォーマンスを達成します。幅広い汎用シナリオでの複雑な知覚タスクに適しています。 |
推論、視覚理解 | 2025-10-15 | インターナショナル |
| Qwen3 シリーズの small スケールの視覚理解モデルは、思考モードと非思考モードを効果的に統合し、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供しながら、高速な応答速度を維持します。拡張ビデオやドキュメントなどの超長コンテキスト、さまざまなドメインでの空間認識とオブジェクト認識をサポートする、画像/動画理解の包括的なアップグレードを特徴としています。2D/3D 視覚ローカライゼーション機能を備えており、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-10-03 | インターナショナル |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの思考バージョンは、高速な応答速度と強化されたマルチモーダル理解および推論能力、視覚エージェント、および長い動画やドキュメントなどの非常に長いコンテキストのサポートを特徴としています。また、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力も誇り、複雑な実世界のタスクに適しています。 |
視覚理解 | 2025-10-03 | インターナショナル |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの Instruct バージョンは、迅速な応答速度を提供し、長い動画やドキュメントなどの非常に長いコンテキストをサポートします。これには、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力、および 2D/3D 視覚ローカライゼーションが含まれており、複雑な実世界の課題に対応できます。 |
推論、視覚理解 | 2025-09-30 | インターナショナル |
| Qwen3-VL シリーズの 8B 密モデルの思考バージョンは、GPU メモリの消費が少なく、マルチモーダル理解と推論を実行できます。長い動画やドキュメントなどの非常に長いコンテキスト、2D/3D 視覚ローカライゼーションをサポートし、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力を備えています。 |
視覚理解 | 2025-09-30 | インターナショナル |
| Qwen3-VL シリーズの 8B 密モデルの Instruct バージョンは、必要な GPU メモリが少なく、包括的にアップグレードされた画像/動画理解、長い動画やドキュメントなどの非常に長いコンテキストのサポート、空間認識、オブジェクト認識能力を提供し、複雑な実世界のタスクに取り組むのに適しています。 |
音声認識 | 2025-09-25 | インターナショナル |
| Fun の多言語音声認識モデルは、31 以上の言語をサポートし、自由な言語切り替えを可能にするため、海外、特に東南アジアに展開するユーザーにとって最適な選択肢です。Fun-asr はこのモデルのアップグレード版です。Fun-asr への切り替えを推奨します。 |
画像生成 | 2025-09-24 | インターナショナル |
| アップグレードされた Wan2.5 プレビューテキスト画像モデル、新しくアップグレードされたモデルアーキテクチャは、視覚的な美学、デザイン感性、リアルな質感を大幅に向上させます。正確な命令遵守に優れ、英語、中国語、およびあまり一般的でない言語でテキストを巧みに生成し、複雑な構造化された長文、チャート、建築図の生成をサポートします。 |
画像生成 | 2025-09-24 | インターナショナル |
| アップグレードされた Wan2.5 プレビュー画像編集モデル、新しくアップグレードされたモデルアーキテクチャは、命令制御による豊富な画像編集機能をサポートし、命令遵守が強化されています。また、高い一貫性を持つ複数画像参照生成を可能にし、優れたテキスト生成パフォーマンスを示します。 |
テキスト生成、推論 | 2025-09-24 | インターナショナル |
| Qwen 3 シリーズ Max モデルは、プレビューバージョンと比較して、エージェントプログラミングとツール呼び出しにおいて専門的なアップグレードが行われています。今回正式にリリースされたモデルは、その分野で最先端 (SOTA) のパフォーマンスを達成しており、より複雑なシナリオで動作するエージェントの要求により適しています。 |
リアルタイム音声翻訳 | 2025-09-24 | インターナショナル |
| 高精度、高応答性、堅牢な多言語対応の音声・映像同時通訳モデルである Qwen3-LiveTranslate-Flash のリアルタイムバージョンです。Qwen3-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。19 の言語を理解し、8 つの中国語方言を含む 10 の言語を話すことができます。 |
音声認識 | 2025-09-24 | インターナショナル |
| 2026 年 4 月に更新された Fun ASR バージョンは、繁体字中国語の 7 大方言 (官話/呉語/湘語/贛語/客家語/閩語/粤語) を完全にサポートし、20 種類以上の地域官話アクセントに対応しています。漢詩のリズム、韻律、文学的表現の特徴に特化した最適化が施されており、詩の認識精度を向上させ、文化遺産、教育解説、オーディオブックに適しています。句読点予測とテキスト正規化能力が向上し、出力テキストが書き言葉の表現習慣により一致するようになりました。数字、日付、金額は自動的に標準形式に変換され、読みやすさと専門性が向上します。言語サポートは、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語の合計 30 言語に拡張されました。このバージョンは 2025 年 11 月 7 日にリリースされたスナップショットと同等です。 |
動画生成 | 2025-09-23 | インターナショナル |
| アップグレードされた Wan2.5 プレビューテキスト動画モデル、新しくアップグレードされたモデルアーキテクチャは、視覚と同期した音声生成をサポートし、10 秒の長尺動画生成を可能にし、強化された命令遵守、改善されたモーション能力、優れた画質を提供します。 |
動画生成 | 2025-09-23 | インターナショナル |
| アップグレードされた Wan2.5 プレビュー画像動画モデル、新しくアップグレードされたモデルアーキテクチャは、視覚と同期した音声生成をサポートし、10 秒の長尺動画生成を可能にし、強化された命令遵守、改善されたモーション能力、優れた画質を提供します。 |
視覚理解 | 2025-09-23 | インターナショナル |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。 |
推論、視覚理解 | 2025-09-23 | インターナショナル |
| Qwen3 シリーズ VL モデルは、マルチモーダル推論能力が大幅に強化されており、特に STEM と数学的推論のためにモデルを最適化することに重点を置いています。視覚認識能力は包括的に改善され、OCR 機能は大幅にアップグレードされました。 |
視覚理解 | 2025-09-23 | インターナショナル |
| Qwen3 シリーズ VL モデルは、視覚コーディングや空間知覚などの分野で包括的にアップグレードされました。その視覚認識能力は大幅に向上し、超長尺動画の理解をサポートし、OCR 機能は大幅に強化されました。 |
リアルタイム音声翻訳 | 2025-09-23 | インターナショナル |
| 高精度、高応答性、堅牢な多言語対応の音声・映像同時通訳モデルである Qwen3-LiveTranslate-Flash のリアルタイムバージョンです。Qwen3-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。19 の言語を理解し、8 つの中国語方言を含む 10 の言語を話すことができます。このバージョンは 2025 年 9 月 22 日のスナップショットバージョンです。 |
テキスト生成 | 2025-09-23 | インターナショナル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。これは 2025 年 9 月 23 日のスナップショットです。以前のバージョン (7 月 22 日のスナップショット) と比較して、下流のタスクパフォーマンスとツール呼び出しにおける堅牢性が向上し、コードセキュリティも強化されています。 |
画像生成 | 2025-09-23 | インターナショナル |
| Qwen シリーズで初めて、複雑なテキストレンダリングと正確な画像編集において大きな進歩を遂げた画像生成基盤モデルです。実験では、画像生成と編集の両方で強力な一般能力が示され、特に中国語のテキストレンダリングで卓越したパフォーマンスを発揮します。 |
リアルタイム音声認識 | 2025-09-23 | インターナショナル |
| これは、Tongyi Lab の次世代エンドツーエンド音声認識モデルのリアルタイムバージョンで、独自の優れた音声技術に基づいており、卓越したコンテキスト認識と高精度の音声書き起こし機能を誇ります。エンドツーエンドアーキテクチャに基づき、Fun-ASR は革新的な RAG 技術を統合し、大規模なホットワードのカスタマイズ、禁止用語やモーダルパーティクルの自動フィルタリング、ITN 正規化、句読点予測などの多次元機能をサポートし、全体的な認識精度とコンテキストの関連性を大幅に向上させます。さらに、Fun-ASR は中国語と英語の柔軟な切り替えをサポートし、複数の地域の方言をカバーし、耐ノイズ性が強化されており、多様で複雑な環境に適応します。 |
音声認識 | 2025-09-19 | インターナショナル |
| Qwen3-Omni-30b-a3b-Captioner は、複雑で変化する音声シナリオで正確かつ包括的なコンテンツ記述を生成するように設計された強力な詳細な音声分析モデルです。複雑な音声や環境音から音楽、映画、テレビの効果音まで、さまざまな音声コンテンツを自動的に解析して記述でき、マルチソースおよび混合環境でも安定した信頼性の高い出力を維持できます。 |
リアルタイムオムニモーダル | 2025-09-17 | インターナショナル |
| Qwen3-Omni-Flash マルチモーダル大規模モデルのリアルタイムバージョンは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。 |
オムニモーダル | 2025-09-17 | インターナショナル |
| Qwen3-Omni-Flash マルチモーダル大規模モデルは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。このバージョンは 2025 年 9 月 15 日のスナップショットバージョンです。 |
音声合成 | 2025-09-16 | インターナショナル |
| Qwen3-TTS-Flash-Realtime-2025-09-18 モデルは、Tongyi の最新のリアルタイム音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を実現します。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。広範なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自律的に調整し、複雑なコンテンツ合成に対して堅牢な能力を発揮します。このモデルはスナップショットバージョンとして提供されます。 |
音声合成 | 2025-09-16 | インターナショナル |
| Qwen 3-TTS-Flash-2025-09-18 は、Tongyi の最新のオフライン音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を可能にします。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。大規模なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自動的に調整し、複雑なコンテンツの合成に対して堅牢な能力を発揮します。このモデルはスナップショットバージョンとして提供されます。 |
音声認識 | 2025-09-16 | インターナショナル |
| Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現します。言語を自動的に判断し、11 の言語の音声を正確に認識でき、複雑な音声環境でも正確な書き起こしを保証します。 |
視覚理解 | 2025-09-16 | インターナショナル |
| Qwen-VL-Plus は、大規模視覚言語モデルの強化版です。ディテール認識とテキスト認識能力を大幅に向上させ、100 万ピクセルを超える解像度と任意の縦横比仕様の画像をサポートします。このモデルは、幅広い視覚タスクで卓越したパフォーマンスを発揮します。 |
視覚理解 | 2025-09-16 | インターナショナル |
| Qwen-VL-Max は、Qwen シリーズの大規模視覚言語モデルです。Plus バージョンと比較して、視覚的推論能力と命令追従能力をさらに強化し、より高いレベルの視覚認識と認知を提供します。より複雑なタスクで最適なパフォーマンスを発揮します。 |
テキスト生成、推論 | 2025-09-16 | インターナショナル |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
視覚理解 | 2025-09-12 | インターナショナル |
| 全く新しい Wan2.2 最初と最後のフレームから動画へのモデルが登場しました。モーションの安定性と成功率を最適化し、プロンプトの遵守を強化し、2 つの画像間のシームレスなトランジションを可能にしました。 |
テキスト生成、推論 | 2025-09-11 | インターナショナル |
| Qwen3 ベースのオープンソース思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Thinking-2507) よりも改善された命令追従と合理化された要約応答を提供します。 |
テキスト生成 | 2025-09-11 | インターナショナル |
| Qwen3 を搭載したオープンソースの非思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Instruct-2507) よりも優れた中国語テキスト理解、強化された論理的推論、およびテキスト生成タスクにおける能力の向上を示しています。 |
テキスト生成、推論 | 2025-09-11 | インターナショナル |
| 2025 年 9 月 11 日のスナップショットとして、このリリースは思考モードでの命令追従の強化と合理化された要約応答を特徴としています。非思考モードは、優れた中国語テキスト理解と強化された論理的推論能力を提供します。このモデルは 1M のコンテキスト長をサポートし、段階的価格設定が適用されます。 |
テキスト生成、推論 | 2025-09-05 | インターナショナル |
| Qwen 3 シリーズの Max モデルのプレビューバージョンで、思考モードと非思考モードの効果的な統合を実現しています。思考モードでは、インテリジェントなエージェントプログラミング、常識的な推論、数学、科学、一般領域にわたる推論などの能力が大幅に向上しています。 |
テキスト埋め込み | 2025-08-25 | インターナショナル |
| 一般テキストベクトル V4 バージョンは、Tongyi Lab が Qwen3 に基づいて開発した多言語テキストベクトルモデルです。V3 バージョンと比較して、テキスト検索、クラスタリング、分類タスクのパフォーマンスを大幅に向上させます。MTEB 多言語、中英、コード検索などの評価タスクで 15% から 40% の改善を達成しています。さらに、64 から 2048 の範囲でユーザー定義のベクトル次元をサポートします。 |
画像生成 | 2025-08-18 | インターナショナル |
| 最初の Qwen 画像編集モデルは、Qwen-Image のテキストレンダリングを編集タスクに拡張します。正確なバイリンガル (中国語/英語) テキスト編集、視覚とセマンティクスの両方の編集、および強力なクロスベンチマークパフォーマンスを提供します。 |
動画生成 | 2025-08-15 | インターナショナル |
| アップグレードされた Wan 2.2 画像動画生成 Flash モデルは、最適化された安定性、より強力なプロンプト追従、テキスト、ポートレート、製品の一貫性の向上、正確なショットコントロールにより、より高速な速度を提供します。 |
リアルタイムオムニモーダル | 2025-08-14 | インターナショナル |
| Qwen の新しい大規模マルチモーダル理解・生成モデルのリアルタイムバージョンで、リアルタイムの音声対話シナリオに適しています。テキスト、画像、ビデオが混在する音声の理解をサポートし、音声とテキストを同時にストリームで生成でき、4 つの自然なトーンを提供します。 |
画像生成 | 2025-08-14 | インターナショナル |
| Qwen シリーズで初めて、複雑なテキストレンダリングと正確な画像編集において大きな進歩を遂げた画像生成基盤モデルです。実験では、画像生成と編集の両方で強力な一般能力が示され、特に中国語のテキストレンダリングで卓越したパフォーマンスを発揮します。 |
テキスト生成、推論 | 2025-08-01 | インターナショナル |
| Qwen3 Flash モデルは、思考モードと非思考モードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令追従とテキスト理解において大幅な向上を示します。1M のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで請求されます。 |
テキスト生成 | 2025-07-31 | インターナショナル |
| Qwen3 ベースのコード生成モデルで、Qwen3-Coder-480B-A35B-Instruct のコーディングエージェント能力を継承しています。同規模でコード能力は SOTA に達しています。 |
テキスト生成、推論 | 2025-07-31 | インターナショナル |
| バランスの取れたパフォーマンスに最適化された Qwen シリーズモデルで、Qwen-Max と Qwen-Turbo の中間の推論効率を提供し、中程度の複雑なタスクを効果的に処理するように設計されています。この動的に更新されるバージョンは、事前の通知なしに変更を実装します。 |
テキスト生成、推論 | 2025-07-30 | インターナショナル |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、論理、数学、科学、コードなどの複雑な思考タスクに優れています。命令追従、テキスト理解、多言語翻訳能力が大幅に向上しました。 |
テキスト生成 | 2025-07-29 | インターナショナル |
| Qwen3 に基づくこのコード生成モデルは、Qwen3-Coder-Plus のコーディングエージェント能力を継承し、マルチターンのツールインタラクションをサポートします。リポジトリレベルの理解とツール呼び出しの安定性向上に重点を置いた最適化が特徴です。 |
テキスト生成 | 2025-07-29 | インターナショナル |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、中国語、英語、および全体的な多言語一般能力が大幅に向上しています。主観的な自由回答タスクに最適化されており、ユーザーの好みに著しく合致し、より役立つ応答を提供します。 |
テキスト生成、推論 | 2025-07-29 | インターナショナル |
| Qwen3 シリーズ Plus モデルは、思考モードと非思考モードを統合し、対話中にモードを切り替えることができます。以前のバージョンと比較して、中国語と英語の能力およびツール呼び出しに特化した機能強化が追加されています。これは 2025 年 7 月 28 日のスナップショットで、初めて 1M のコンテキスト長をサポートし、段階的価格設定を使用します。 |
動画生成 | 2025-07-28 | インターナショナル |
| アップグレードされた Wan 2.2 Plus テキスト動画生成モデルは、安定したスイーピング複合動作、映画的な視覚制御、より強力なプロンプト追従、リアルな世界の再現により、より高品質な結果を提供します。 |
画像生成 | 2025-07-28 | インターナショナル |
| アップグレードされた Wan 2.2 Plus テキスト画像生成モデルは、創造性、安定性、リアリズムが向上した、より豊かな画像ディテールを提供します。また、より強力なプロンプト追従と複数のスタイルのネイティブサポートも特徴です。最大 200 万ピクセルの生成とプロンプト強化もサポートされています。 |
画像生成 | 2025-07-28 | インターナショナル |
| アップグレードされた Wan 2.2 Flash テキスト画像生成モデルは、創造性、安定性、リアリズムが向上し、より高速な速度を提供します。また、より強力なプロンプト追従と複数のスタイルのネイティブサポートも特徴です。最大 200 万ピクセルの生成とプロンプト強化もサポートされています。 |
動画生成 | 2025-07-28 | インターナショナル |
| アップグレードされた Wan 2.2 Plus 画像動画生成モデルは、最適化された安定性、より強力なプロンプト追従、テキスト、ポートレート、製品の一貫性の向上、正確なショットコントロールにより、より高品質な結果を提供します。 |
テキスト生成、推論 | 2025-07-25 | インターナショナル |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、論理能力、一般能力、知識強化、創造性が大幅に向上しており、高難易度で強力な思考を要するシナリオに適しています。 |
テキスト生成 | 2025-07-24 | インターナショナル |
| Qwen-MT-Turbo は、多言語翻訳に特化した Qwen モデルシリーズ内の大規模言語モデルです。92 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格帯で提供します。また、用語介入、フォーマット保持、ドメイン固有の翻訳などの機能も提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
テキスト生成 | 2025-07-24 | インターナショナル |
| Qwen シリーズのフラッグシップ翻訳モデルである Qwen-MT-Plus は、Qwen3 アーキテクチャで完全にアップグレードされました。92 の言語をサポートし、非常に正確で自然な響きの翻訳を提供します。コンテキスト理解、用語制御、フォーマット保持における高度な能力により、特に専門分野において従来のモデルよりも優れた選択肢となります。 |
テキスト生成 | 2025-07-23 | インターナショナル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。 |
テキスト生成 | 2025-07-23 | インターナショナル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデル。コード能力はオープンソースの SOTA に達しています。 |
テキスト生成 | 2025-07-23 | インターナショナル |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、主観的な創造性とモデルの安全性にわずかな改善が見られます。 |
テキスト生成、推論 | 2025-07-23 | インターナショナル |
| Qwen3 シリーズの Plus モデルは、思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。これは 2025 年 7 月 14 日のスナップショットです。以前のバージョンと比較して、非思考モードでの中国語と英語の両方の能力が大幅に向上し、ツール呼び出し能力も強化されています。 |
テキスト生成 | 2025-07-21 | インターナショナル |
| Qwen ロールプレイングモデルシリーズは、日本の擬人化対話シナリオに特化して最適化されています。キャラクターの一貫性維持、コンテキストを意識した対話の進行、共感的な関与において高度な能力を発揮し、正確なパーソナライズされたキャラクターの具現化を可能にします。このバージョンは、日本語の言語ローカライゼーション (方言や敬語を含む)、人間らしいロールプレイングの信憑性、物語の一貫性制御、シナリオベースの認知インテリジェンスを大幅に強化しています。 |
オムニモーダル | 2025-07-18 | インターナショナル |
| 新しいマルチモーダル理解・生成モデルで、テキスト、画像、音声、ビデオ入力、および混合入力理解をサポートします。テキストと音声を同時にストリームでき、マルチモーダルコンテンツ理解の速度が大幅に向上しています。さらに、4 つの自然な対話トーンを提供します。 |
画像生成 | 2025-05-22 | インターナショナル |
| Wan2.1 Text-to-Image Turbo バージョン、生成速度が向上しました。画像の美しさ、リアリズム、芸術性がアップグレードされました。より強力なセマンティック理解能力、豊富なスタイル汎化能力、最大 200 万ピクセルの生成をサポートし、スマートプロンプトリライトをサポートします。 |
画像生成 | 2025-05-22 | インターナショナル |
| Wan2.1 Text-to-Image Plus バージョン、より多くの画像ディテールを生成します。画像の美しさ、リアリズム、芸術性がアップグレードされました。より強力なセマンティック理解能力、豊富なスタイル汎化能力、最大 200 万ピクセルの生成をサポートし、スマートプロンプトリライトをサポートします。 |
動画生成 | 2025-05-14 | インターナショナル |
| Wan2.1-VACE-Plus オールインワンビデオ作成・編集モデル。ローカル編集、ビデオ再描画、背景アウトペインティング、持続時間延長、画像参照、その他のビデオ編集および生成タスクをサポートし、テキスト、画像、ビデオによるマルチモーダル条件付き制御をサポートします。 |
テキスト生成、推論 | 2025-05-12 | インターナショナル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-7B を大幅に上回ります。 |
テキスト生成、推論 | 2025-05-12 | インターナショナル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-32B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | インターナショナル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、より小さなパラメーターサイズで QwQ-32B に匹敵し、一般能力は Qwen2.5-14B を大幅に上回り、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | インターナショナル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-72B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | インターナショナル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-14B を大幅に上回ります。 |
テキスト生成、推論 | 2025-04-29 | インターナショナル |
| Qwen3 シリーズの Plus モデルは、思考モードと非思考モードを効果的に統合し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-Plus を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。このモデルは 2025 年 4 月 28 日のスナップショットです。 |
動画生成 | 2025-04-07 | インターナショナル |
| Wan2.1 開始フレームと終了フレームから動画への Plus バージョンは、2 つの画像に対してスムーズなトランジション動画を生成します。大規模で複雑な動き、物理法則の遵守、豊かな芸術的スタイル、映画・テレビレベルの視覚品質をサポートします。命令に従う能力がさらに強化され、生成される動画のディテールがより豊かになります。 |
オムニモーダル | 2025-03-26 | インターナショナル |
| Qwen2.5 に基づいてトレーニングされた新しいマルチモーダル理解・生成モデルです。テキスト、画像、音声、ビデオ、および混合入力理解をサポートし、テキストと音声のストリームを同時に生成でき、マルチモーダルコンテンツ理解の速度を大幅に向上させます。4 つの自然なトーンを提供します。 |
推論、視覚理解 | 2025-03-26 | インターナショナル |
| Tongyi Qianwen QVQ 視覚的推論モデルは、視覚入力と Chain-of-Thought 出力をサポートし、数学、プログラミング、視覚分析、作成、および一般タスクにおいてより強力な能力を発揮します。 |
推論 | 2025-03-05 | インターナショナル |
| Qwen QwQ 推論モデルの強化版で、Qwen2.5 モデルでトレーニングされ、強化学習によって推論能力が大幅に向上しました。数学とコーディングのコアメトリック (例:AIME 24/25、LiveCodeBench) および一部の一般メトリック (例:IFEval、LiveBench) は、DeepSeek-R1 のフルバージョンレベルに達しています。 |
動画生成 | 2025-02-27 | インターナショナル |
| Wan2.1 画像動画生成 Turbo バージョンは、静止画像を動画に生成します。大規模で複雑な動き、物理法則の遵守、芸術的なスタイル、映画の視覚品質をサポートします。命令に従う能力がさらに向上し、生成がより高速になります。 |
テキスト生成、推論 | 2025-01-30 | インターナショナル |
| Qwen3 シリーズの Turbo モデルです。思考モードと非思考モードを効果的に統合し、会話中にモードを切り替えることができます。その推論能力は、より小さなパラメーターサイズで QwQ-32B に匹敵し、一般能力は Qwen2.5-Turbo を大幅に上回り、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成 | 2025-01-30 | インターナショナル |
| Qwen シリーズのモデルは、能力のバランスが取れており、Qwen-Max と Qwen-Turbo の中間の推論パフォーマンスと速度を提供し、中程度の複雑なタスクに適しています。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成 | 2025-01-30 | インターナショナル |
| Qwen-Max は、数百億のパラメーター規模と、中国語や英語などの複数の入力言語をサポートします。Qwen-Max はローリング方式で更新されます。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
動画生成 | 2025-01-20 | インターナショナル |
| Wan2.1 画像動画生成 Plus バージョンは、静止画像を動画に生成します。大規模で複雑な動き、物理法則の遵守、芸術的なスタイル、映画の視覚品質をサポートします。命令に従う能力がさらに向上し、より良いビデオ品質を実現します。 |
動画生成 | 2025-01-09 | インターナショナル |
| Wan2.1 テキスト動画生成 Turbo バージョン、1 文で動画を生成します。大規模で複雑な動き、物理法則の遵守、芸術的なスタイル、映画の視覚品質をサポートします。命令に従う能力がさらに向上し、生成速度が向上します。 |
動画生成 | 2025-01-09 | インターナショナル |
| Wan2.1 テキスト動画生成 Plus バージョン、1 文で動画を生成します。大規模で複雑な動き、物理法則の遵守、芸術的なスタイル、映画の視覚品質をサポートします。命令に従う能力がさらに向上し、より良いビデオ品質を実現します。 |
テキスト埋め込み | 2024-07-12 | インターナショナル |
| 一般テキストベクトル化モデルは、Tongyi Lab が大規模言語モデル (LLM) 基盤に基づいて開発した多言語統一テキストベクトル化モデルです。このモデルは、世界中の複数の主流言語向けに設計されており、開発者がテキストデータを高品質なベクトルデータに変換するのを支援する高度なベクトル化サービスを提供します。 |
米国 (バージニア)
モデルタイプ | 日付 | サービス範囲 | モデル ID | 説明 |
|---|---|---|---|---|
テキスト生成、推論、視覚理解 | 2026-09-02 | グローバル |
| Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) is an upgraded snapshot of qwen3.8-max. Coding capability breaks new ground, handling more complex engineering-scale projects and long-horizon autonomous development. Collaborative agent performance is significantly enhanced, with greater composure in multi-tool orchestration and end-to-end task delivery. Native vision understanding is refined across chart reasoning, document parsing, and multimodal perception — sharper and more reliable. Retains the 1M context window, thinking mode, and full tool ecosystem, evolving at a higher level of intelligence. |
ロールプレイ | 2026-08-30 | グローバル |
| Qwen ロールプレイングモデルシリーズは、多言語の擬人化対話シナリオに特化して最適化されています。キャラクターの一貫性維持、コンテキストを意識した対話の進行、共感的な関与において高度な能力を発揮し、正確なパーソナライズされたキャラクターの具現化を可能にします。このバージョンは、日本語の言語ローカライゼーション (方言や敬語を含む)、人間らしいロールプレイングの信憑性、物語の一貫性制御、シナリオベースの認知インテリジェンスを大幅に強化しています。 |
テキスト生成、深い思考、視覚理解 | 2026-08-26 | インターナショナル |
| Qwen3.8-Flash は千問3.8シリーズの軽量フラッグシップモデルで、100万トークンのコンテキストウィンドウ、最大128kの出力長、256kの思考バジェットをサポートします。深い推論、Function Calling、構造化出力、組み込みツール、ネイティブ視覚理解に対応し、性能とコストの最適なバランスを実現します。日常的なテキスト生成からエージェントシナリオまで幅広いタスクに適しています。 |
動画生成 | 2026-08-20 | グローバル |
| Wan3.0-Video-Prime は、Wan3.0 動画生成モデルの高速バージョンであり、その機能は Wan3.0-Video 標準バージョンに準拠しています。4 モーダル完全参照入力をサポートし、最大 30 秒の動画を生成でき、エンドツーエンドの速度が大幅に向上した没入感のある視聴覚体験を提供します。 |
テキスト生成、推論 | 2026-08-19 | 米国 |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論 | 2026-08-14 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ Mixture-of-Experts (MoE) 大規模言語モデルです。ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。広範な高品質データでトレーニングされたこのモデルは、数学的・論理的推論、複雑な推論、プロフェッショナルなコード生成、詳細な長文ドキュメント分析において強力なパフォーマンスを発揮し、先端科学研究、複雑な企業ワークフロー、高度なエージェントアプリケーションなどの要求の厳しいシナリオに適しています。 |
動画生成 | 2026-08-06 | グローバル |
| Wan3.0 は、参照、編集、複製、駆動などの複数の創造的機能を統一的にサポートするオールインワン動画生成モデルです。4 モーダル完全参照入力、最大 30 秒の動画生成をサポートし、ファイル、Web ページ、複雑な画像を解析できます。プロダクションレベルのキャラクター一貫性とリアルな音声と映像により、没入感のある視聴覚的インパクトを提供します。 |
テキスト生成、推論、視覚理解 | 2026-08-02 | グローバル |
| 2.4 兆パラメーターの MoE フラッグシップで、コーディングとオフィス能力が包括的に飛躍し、数日間にわたって自律的にコーディングして完全なプロジェクトを提供できます。法律、金融、デザインなどの数百の専門的なタスクを処理し、1 回の対話でエンドツーエンドのプロダクションレベルの結果を提供します。ネイティブの視覚理解は、計画、実行、検証のパイプライン全体を通じて実行され、超長文ドキュメントと長尺動画の深層セマンティック解析をサポートします。長期タスクにおいて自律的計画とクローズドループ反復を実行し、継続的に進化します。 |
テキスト生成、推論 | 2026-08-01 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-07-21 | グローバル |
| Qwen3.7 ネイティブ視覚言語シリーズ Flash モデルは、3.6-Flash と比較してマルチモーダル理解とエージェント実行能力を包括的に強化しています。主な改善点には、基礎的なマルチモーダル能力の強化、オブジェクト認識の向上、実世界認識と空間的知性の改善が含まれます。Search Agent や CI Agent などのマルチモーダルエージェントシナリオは大幅にアップグレードされ、より安定したエンドツーエンドのタスク実行が可能になりました。マルチモーダルコーディング能力が最適化され、よりスムーズな Vibe コーディング体験を提供します。 |
テキスト生成、推論 | 2026-07-07 | 米国 |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
テキスト生成、推論、視覚理解 | 2026-07-03 | 米国 |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成 | 2026-07-02 | グローバル |
| Qwen シリーズのロールプレイングモデルです。これは動的に更新されるバージョンであり、モデルの更新については事前に通知が提供されます。擬人化ロールプレイングに適しており、事前定義されたキャラクターの指示に従う、会話を進める、積極的な傾聴と共感を示す能力が最適化されています。さらに、パーソナライズされたキャラクターの深い復元をサポートします。 |
テキスト生成、推論、視覚理解 | 2026-06-26 | 米国 |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
テキスト生成、推論 | 2026-06-26 | 米国 |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-T2V は、セマンティック理解、映画的なショットコントロール、ダイナミックなモーションレンダリングが向上した Text-to-Video 生成をサポートします。創造的な意図をより正確に捉え、より滑らかな動き、豊かなディテール、強力な視覚的一貫性、そしてより自然なキャラクターのアクション、シーンの雰囲気、物理的なダイナミクスを持つ高品質な動画を生成します。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-R2V は、被写体、シーンスタイル、視覚的一貫性の安定性が大幅に向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像をサポートし、創造的な意図をより正確に理解して保持し、キャラクター、シーン、スタイル、映画的な動き全体でより強力な制御性と表現力を提供します。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-I2V は、視覚品質、動的パフォーマンス、クリップ間の一貫性が向上した Image-to-Video 生成をサポートします。入力画像をより正確に理解し、創造的な意図を保持することで、肌の質感のリアリズム、クリップ間のキャラクター ID の一貫性、動きの滑らかさ、テキストレンダリングの安定性、視聴覚同期が大幅に改善され、より高いリアリズム、豊かなディテール、強力な全体的一貫性を持つ高品質な動画を生成します。 |
テキスト生成、推論 | 2026-06-16 | グローバル |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
テキスト生成、推論、視覚理解 | 2026-06-15 | グローバル |
| kimi-k2.7-code は、Kimi のこれまでで最もインテリジェントなコーディングモデルです。ロングコンテキストでより確実に命令に従い、より高い成功率でプログラミングタスクを完了します。テキスト、画像、動画の入力をサポートし、思考モード、会話、エージェントタスクにも対応しています。 |
テキスト生成、推論、視覚理解 | 2026-06-09 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、5 月 20 日のスナップショットと比較して視覚モーダル理解が追加され、実世界のシーンを認識し、マルチモーダル対話型ハイブリッドエージェント機能をサポートします。このバージョンは 2026 年 6 月 8 日に取得されたスナップショットに基づいています。 |
テキスト生成、推論、視覚理解 | 2026-06-01 | グローバル |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
テキスト生成、推論 | 2026-05-20 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
テキスト生成、推論 | 2026-05-11 | 米国 |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ MoE 大規模モデルで、ネイティブで最大 100 万トークンのコンテキスト長をサポートします。膨大な高品質データコーパスでトレーニングされており、高度な数学的推論、複雑な論理的推論、専門的なコーディング、長文テキストの詳細な分析に優れており、最先端の研究、洗練されたオフィスワークフロー、高度な AI エージェントなどの要求の厳しいアプリケーションに適しています。 |
テキスト生成、推論 | 2026-05-11 | 米国 |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-04-29 | グローバル |
| Kimi-k2.5 は、Moonshot AI の最も多機能なモデルで、ネイティブのマルチモーダルアーキテクチャを備え、視覚/テキスト入力、思考/非思考モード、および対話とエージェントタスクの両方をサポートします。 |
動画生成 | 2026-04-26 | グローバル |
| HappyHorse-1.0-V2V は、自然言語の命令による高度なビデオ編集をサポートします。最大 5 枚の参照画像を使用してビデオ要素の局所的または全体的な編集を可能にし、元の動きのダイナミクスを正確に保持して優れた表現力を実現します。 |
動画生成 | 2026-04-26 | グローバル |
| HappyHorse-1.0-R2V は、被写体とシーンの参照における安定性が向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像を処理でき、創造的な意図を正確に保持して優れたパフォーマンスを提供します。 |
テキスト生成、推論 | 2026-04-24 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ MoE 大規模モデルで、ネイティブで最大 100 万トークンのコンテキスト長をサポートします。膨大な高品質データコーパスでトレーニングされており、高度な数学的推論、複雑な論理的推論、専門的なコーディング、長文テキストの詳細な分析に優れており、最先端の研究、洗練されたオフィスワークフロー、高度な AI エージェントなどの要求の厳しいアプリケーションに適しています。 |
テキスト生成、推論 | 2026-04-24 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
動画生成 | 2026-04-22 | グローバル |
| HappyHorse-1.0-T2V は、非常にリアルな動的レンダリングを特徴とするテキスト動画生成をサポートします。テキストのセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
動画生成 | 2026-04-22 | グローバル |
| HappyHorse-1.0-I2V は、非常にリアルな動的レンダリングを特徴とする画像動画生成を可能にします。テキストと画像の両方のセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | グローバル |
| Qwen3.6 35B-A3B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートフレームワークを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3.5-35B-A3B と比較して、このモデルはエージェントコーディング能力、数学的およびコード推論能力、空間的知性、ならびにオブジェクトローカライゼーションおよびオブジェクト検出パフォーマンスが大幅に向上しています。 |
テキスト生成、推論 | 2026-04-14 | グローバル |
| GLM-5.1 は、Zhipu AI によって開発されたモデルで、長期タスク向けに特別に設計されています。7,440 億のパラメーターを持ち、20 万トークンの超長コンテキストをサポートし、1 回の応答で最大 12 万 8,000 トークンを生成できます。GLM-5.1 は、論理的推論、長文理解、コード生成に優れており、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れた結果を出し、インテリジェントなヒューマンコンピュータインタラクション、エンタープライズソリューション、開発者支援などのアプリケーションに適しています。 |
テキスト生成、推論、視覚理解 | 2026-04-01 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Plus シリーズモデルは、現在の最先端モデルに匹敵する卓越したパフォーマンスを示し、3.5 シリーズと比較して全体的な結果が大幅に向上しています。このモデルは、エージェントコーディング、フロントエンドプログラミング、Vibe コーディングなどのコード関連能力、およびマルチモーダル一般オブジェクト認識、OCR、オブジェクトローカライゼーションにおいて著しく強化されています。 |
テキスト生成 | 2026-03-30 | 米国 |
| Qwen-MT-Lite は、多言語翻訳に特化した Qwen モデルシリーズの大規模言語モデルです。32 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格で提供します。用語介入、フォーマット保持、ドメイン固有の翻訳などの機能を提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
視覚理解 | 2026-03-14 | 米国 |
| Qwen3 シリーズの small サイズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。2025 年 10 月 15 日に取得されたスナップショットと比較して、モデルの全体的なパフォーマンスは大幅に向上しています。一般的な視覚認識と推論の能力が向上し、セキュリティ、店舗内検査、機器モニタリング、写真ベースの問題解決などのさまざまなビジネスシナリオでの認識精度が著しく向上しています。このバージョンは 2026 年 1 月 22 日時点のスナップショットです。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 ネイティブ視覚言語 Flash モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルタスクの両方でパフォーマンスが飛躍的に向上し、推論速度と全体的なパフォーマンスのバランスを取りながら高速な応答時間を提供します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 シリーズ 35B-A3B は、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャで設計されたネイティブ視覚言語モデルで、より高い推論効率を実現しています。その全体的なパフォーマンスは Qwen3.5-27B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 27B ネイティブ視覚言語密モデルは、線形アテンションメカニズムを組み込んでおり、推論速度とパフォーマンスのバランスを取りながら高速な応答時間を提供します。その全体的な能力は Qwen3.5-122B-A10B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 122B-A10B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。全体的なパフォーマンスの観点から、このモデルは Qwen3.5-397B-A17B に次ぐものです。そのテキスト能力は Qwen3-235B-2507 を大幅に上回り、視覚能力は Qwen3-VL-235B を超えています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 | グローバル |
| Qwen3.5 ネイティブ視覚言語シリーズ Plus モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。さまざまなタスク評価において、3.5 シリーズは一貫して最先端の主要モデルと同等のパフォーマンスを示しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルの両方の能力で飛躍的な進歩を示しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 | グローバル |
| Qwen3.5 シリーズ 397B-A17B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。言語理解、論理的推論、コード生成、エージェントベースのタスク、画像理解、動画理解、グラフィカルユーザーインターフェイス (GUI) インタラクションなど、幅広いタスクで最先端のモデルに匹敵する最先端のパフォーマンスを提供します。堅牢なコード生成とエージェント能力により、このモデルは多様なエージェントで強力な汎化能力を示します。 |
動画生成 | 2025-12-16 | グローバル |
| Wan2.6 参照動画生成は、指定された人物または任意のオブジェクトをリファレンスとして使用することをサポートし、外観と声の一貫性を正確に維持し、共同パフォーマンスのための複数キャラクター参照を可能にします。 |
画像生成 | 2025-12-15 | グローバル |
| Wan2.6 Text-to-Image、アップグレードされた視覚品質、美学、命令追従により、正確なスタイル制御、リアルなポートレート、長文理解、広範な歴史的/文化的 IP のカバレッジを提供し、高品質で表現力豊かな視覚生成を可能にします。 |
画像生成 | 2025-12-15 | グローバル |
| Wan2.6 Image は、テキストと画像の共同推論、複数画像の創造的融合、商用レベルの一貫性、美的スタイル変換、フレーミングとライティングの正確な制御をサポートするオールラウンドな画像生成モデルで、画像生成における一貫性、制御性、表現力を大幅に向上させます。 |
動画生成 | 2025-12-03 | 米国 |
| Wan2.6 テキスト動画生成、インテリジェントなショットスケジューリングはマルチショットストーリーテリングをサポートし、一貫した被写体、シーン、雰囲気を持つマルチショットの物語動画を生成し、最大持続時間は 15 秒です。より良い命令追従と改善された視覚的忠実度を提供します。 |
動画生成 | 2025-12-03 | グローバル |
| Wan2.6 テキスト動画生成、インテリジェントなショットスケジューリングはマルチショットストーリーテリングをサポートし、一貫した被写体、シーン、雰囲気を持つマルチショットの物語動画を生成し、最大持続時間は 15 秒です。より良い命令追従と改善された視覚的忠実度を提供します。 |
動画生成 | 2025-12-03 | 米国 |
| Wan2.6 画像動画生成、インテリジェントなショットスケジューリングによりマルチカメラストーリーテリングが可能になり、より高品質な音声生成を提供し、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
動画生成 | 2025-12-03 | グローバル |
| Wan2.6 画像動画生成、インテリジェントなショットスケジューリングによりマルチカメラストーリーテリングが可能になり、より高品質な音声生成を提供し、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
テキスト生成、推論 | 2025-12-01 | 米国 |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
テキスト生成、推論 | 2025-12-01 | グローバル |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
視覚理解 | 2025-11-21 | グローバル |
| このモデルは 2025 年 11 月 20 日のスナップショットバージョンであり、最新の Qwen-VL3 アーキテクチャに基づいて包括的にアップグレードされています。ドキュメント解析とテキストローカライゼーション能力が大幅に向上し、エンドツーエンドのレイテンシと幻覚が大幅に削減されています。 |
テキスト生成 | 2025-11-19 | グローバル |
| Qwen-MT-Lite は、多言語翻訳に特化した Qwen モデルシリーズの大規模言語モデルです。32 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格で提供します。用語介入、フォーマット保持、ドメイン固有の翻訳などの機能を提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
テキスト生成 | 2025-11-11 | グローバル |
| Qwen シリーズの大規模言語モデルである Qwen-MT-Flash は、Qwen 3 アーキテクチャで完全にアップグレードされ、パフォーマンスと翻訳品質が大幅に向上しました。92 の言語で迅速かつコスト効率の高い翻訳を提供し、用語介入、フォーマット保持、ドメイン固有の適応などの高度な機能をサポートします。速度、品質、コストの強力なバランスを必要とするアプリケーションに最適な選択肢です。 |
推論、視覚理解 | 2025-10-21 | グローバル |
| Qwen3-VL シリーズで最大の密モデルであり、その推論バージョンは Qwen3-VL-235B-Thinking に次ぐマルチモーダル推論能力を誇ります。STEM と数学の問題解決、一般的な画像および動画理解に優れ、マルチモーダルエージェント能力で最先端のパフォーマンスを達成しており、複雑なマルチモーダル推論タスクに最適です。 |
視覚理解 | 2025-10-21 | グローバル |
| Qwen3-VL シリーズで最大の密モデルであり、非推論バージョンでは、Qwen3-VL-235B-Instruct に次ぐ全体的なパフォーマンスを提供します。ドキュメント認識と理解に優れ、強力な空間認識とオブジェクト識別能力を示し、2D 視覚検出と空間的推論で最先端のパフォーマンスを達成します。幅広い汎用シナリオでの複雑な知覚タスクに適しています。 |
視覚理解 | 2025-10-15 | 米国 |
| Qwen3 シリーズの small スケールの視覚理解モデルは、思考モードと非思考モードを効果的に統合し、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供しながら、高速な応答速度を維持します。拡張ビデオやドキュメントなどの超長コンテキスト、さまざまなドメインでの空間認識とオブジェクト認識をサポートする、画像/動画理解の包括的なアップグレードを特徴としています。2D/3D 視覚ローカライゼーション機能を備えており、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-10-15 | グローバル |
| Qwen3 シリーズの small スケールの視覚理解モデルは、思考モードと非思考モードを効果的に統合し、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供しながら、高速な応答速度を維持します。拡張ビデオやドキュメントなどの超長コンテキスト、さまざまなドメインでの空間認識とオブジェクト認識をサポートする、画像/動画理解の包括的なアップグレードを特徴としています。2D/3D 視覚ローカライゼーション機能を備えており、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-10-03 | グローバル |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの思考バージョンは、高速な応答速度と強化されたマルチモーダル理解および推論能力、視覚エージェント、および長い動画やドキュメントなどの非常に長いコンテキストのサポートを特徴としています。また、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力も誇り、複雑な実世界のタスクに適しています。 |
視覚理解 | 2025-10-03 | グローバル |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの Instruct バージョンは、迅速な応答速度を提供し、長い動画やドキュメントなどの非常に長いコンテキストをサポートします。これには、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力、および 2D/3D 視覚ローカライゼーションが含まれており、複雑な実世界の課題に対応できます。 |
推論、視覚理解 | 2025-09-30 | グローバル |
| Qwen3-VL シリーズの 8B 密モデルの思考バージョンは、GPU メモリの消費が少なく、マルチモーダル理解と推論を実行できます。長い動画やドキュメントなどの非常に長いコンテキスト、2D/3D 視覚ローカライゼーションをサポートし、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力を備えています。 |
視覚理解 | 2025-09-30 | グローバル |
| Qwen3-VL シリーズの 8B 密モデルの Instruct バージョンは、必要な GPU メモリが少なく、包括的にアップグレードされた画像/動画理解、長い動画やドキュメントなどの非常に長いコンテキストのサポート、空間認識、オブジェクト認識能力を提供し、複雑な実世界のタスクに取り組むのに適しています。 |
テキスト生成、推論 | 2025-09-24 | グローバル |
| Qwen 3 シリーズ Max モデルは、プレビューバージョンと比較して、エージェントプログラミングとツール呼び出しにおいて専門的なアップグレードが行われています。今回正式にリリースされたモデルは、その分野で最先端 (SOTA) のパフォーマンスを達成しており、より複雑なシナリオで動作するエージェントの要求により適しています。 |
視覚理解 | 2025-09-23 | グローバル |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。 |
推論、視覚理解 | 2025-09-23 | グローバル |
| Qwen3 シリーズ VL モデルは、マルチモーダル推論能力が大幅に強化されており、特に STEM と数学的推論のためにモデルを最適化することに重点を置いています。視覚認識能力は包括的に改善され、OCR 機能は大幅にアップグレードされました。 |
視覚理解 | 2025-09-23 | グローバル |
| Qwen3 シリーズ VL モデルは、視覚コーディングや空間知覚などの分野で包括的にアップグレードされました。その視覚認識能力は大幅に向上し、超長尺動画の理解をサポートし、OCR 機能は大幅に強化されました。 |
テキスト生成 | 2025-09-23 | グローバル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。これは 2025 年 9 月 23 日のスナップショットです。以前のバージョン (7 月 22 日のスナップショット) と比較して、下流のタスクパフォーマンスとツール呼び出しにおける堅牢性が向上し、コードセキュリティも強化されています。 |
音声認識 | 2025-09-16 | 米国 |
| Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現します。言語を自動的に判断し、11 の言語の音声を正確に認識でき、複雑な音声環境でも正確な書き起こしを保証します。 |
テキスト生成、推論 | 2025-09-16 | 米国 |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成、推論 | 2025-09-16 | グローバル |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成、推論 | 2025-09-11 | グローバル |
| Qwen3 ベースのオープンソース思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Thinking-2507) よりも改善された命令追従と合理化された要約応答を提供します。 |
テキスト生成 | 2025-09-11 | グローバル |
| Qwen3 を搭載したオープンソースの非思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Instruct-2507) よりも優れた中国語テキスト理解、強化された論理的推論、およびテキスト生成タスクにおける能力の向上を示しています。 |
テキスト生成、推論 | 2025-09-11 | グローバル |
| 2025 年 9 月 11 日のスナップショットとして、このリリースは思考モードでの命令追従の強化と合理化された要約応答を特徴としています。非思考モードは、優れた中国語テキスト理解と強化された論理的推論能力を提供します。このモデルは 1M のコンテキスト長をサポートし、段階的価格設定が適用されます。 |
テキスト生成、推論 | 2025-09-05 | グローバル |
| Qwen 3 シリーズの Max モデルのプレビューバージョンで、思考モードと非思考モードの効果的な統合を実現しています。思考モードでは、インテリジェントなエージェントプログラミング、常識的な推論、数学、科学、一般領域にわたる推論などの能力が大幅に向上しています。 |
テキスト生成、推論 | 2025-08-01 | 米国 |
| Qwen3 Flash モデルは、思考モードと非思考モードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令追従とテキスト理解において大幅な向上を示します。1M のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで請求されます。 |
テキスト生成、推論 | 2025-08-01 | グローバル |
| Qwen3 Flash モデルは、思考モードと非思考モードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令追従とテキスト理解において大幅な向上を示します。1M のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで請求されます。 |
テキスト生成 | 2025-07-31 | グローバル |
| Qwen3 ベースのコード生成モデルで、Qwen3-Coder-480B-A35B-Instruct のコーディングエージェント能力を継承しています。同規模でコード能力は SOTA に達しています。 |
テキスト生成、推論 | 2025-07-30 | グローバル |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、論理、数学、科学、コードなどの複雑な思考タスクに優れています。命令追従、テキスト理解、多言語翻訳能力が大幅に向上しました。 |
テキスト生成 | 2025-07-29 | グローバル |
| Qwen3 に基づくこのコード生成モデルは、Qwen3-Coder-Plus のコーディングエージェント能力を継承し、マルチターンのツールインタラクションをサポートします。リポジトリレベルの理解とツール呼び出しの安定性向上に重点を置いた最適化が特徴です。 |
テキスト生成 | 2025-07-29 | グローバル |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、中国語、英語、および全体的な多言語一般能力が大幅に向上しています。主観的な自由回答タスクに最適化されており、ユーザーの好みに著しく合致し、より役立つ応答を提供します。 |
テキスト生成、推論 | 2025-07-29 | グローバル |
| Qwen3 シリーズ Plus モデルは、思考モードと非思考モードを統合し、対話中にモードを切り替えることができます。以前のバージョンと比較して、中国語と英語の能力およびツール呼び出しに特化した機能強化が追加されています。これは 2025 年 7 月 28 日のスナップショットで、初めて 1M のコンテキスト長をサポートし、段階的価格設定を使用します。 |
テキスト生成、推論 | 2025-07-25 | グローバル |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、論理能力、一般能力、知識強化、創造性が大幅に向上しており、高難易度で強力な思考を要するシナリオに適しています。 |
テキスト生成 | 2025-07-24 | グローバル |
| Qwen シリーズのフラッグシップ翻訳モデルである Qwen-MT-Plus は、Qwen3 アーキテクチャで完全にアップグレードされました。92 の言語をサポートし、非常に正確で自然な響きの翻訳を提供します。コンテキスト理解、用語制御、フォーマット保持における高度な能力により、特に専門分野において従来のモデルよりも優れた選択肢となります。 |
テキスト生成 | 2025-07-23 | グローバル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。 |
テキスト生成 | 2025-07-23 | グローバル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデル。コード能力はオープンソースの SOTA に達しています。 |
テキスト生成 | 2025-07-23 | グローバル |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、主観的な創造性とモデルの安全性にわずかな改善が見られます。 |
視覚理解 | 2025-07-07 | グローバル |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-7B を大幅に上回ります。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-32B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、より小さなパラメーターサイズで QwQ-32B に匹敵し、一般能力は Qwen2.5-14B を大幅に上回り、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-72B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-14B を大幅に上回ります。 |
中国 (北京)
モデルタイプ | 日付 | モデル ID | 説明 |
|---|---|---|---|
テキスト生成、推論、視覚理解 | 2026-09-02 |
| Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) is an upgraded snapshot of qwen3.8-max. Coding capability breaks new ground, handling more complex engineering-scale projects and long-horizon autonomous development. Collaborative agent performance is significantly enhanced, with greater composure in multi-tool orchestration and end-to-end task delivery. Native vision understanding is refined across chart reasoning, document parsing, and multimodal perception — sharper and more reliable. Retains the 1M context window, thinking mode, and full tool ecosystem, evolving at a higher level of intelligence. |
テキスト生成、深い思考、視覚理解 | 2026-08-26 |
| Qwen3.8-Flash は千問3.8シリーズの軽量フラッグシップモデルで、100万トークンのコンテキストウィンドウ、最大128kの出力長、256kの思考バジェットをサポートします。深い推論、Function Calling、構造化出力、組み込みツール、ネイティブ視覚理解に対応し、性能とコストの最適なバランスを実現します。日常的なテキスト生成からエージェントシナリオまで幅広いタスクに適しています。 |
動画生成 | 2026-08-20 |
| Wan3.0-Video-Prime は、Wan3.0 動画生成モデルの高速バージョンであり、その機能は Wan3.0-Video 標準バージョンに準拠しています。4 モーダル完全参照入力をサポートし、最大 30 秒の動画を生成でき、エンドツーエンドの速度が大幅に向上した没入感のある視聴覚体験を提供します。 |
テキスト生成、推論、視覚理解 | 2026-08-19 |
| Kimi K3 は、2.8 兆のパラメーターを持つ Kimi の最も強力なフラッグシップモデルです。KDA ハイブリッド線形アテンション (Kimi Delta Attention) および Attention Residuals 技術に基づいて構築されており、ネイティブで視覚理解をサポートし、100 万トークンのコンテキストウィンドウを備えています。これは、ロングコンテキストプログラミング、ナレッジワーク、および高度な推論のために設計された、世界初のオープンソース 3 兆パラメーターモデルです。 |
テキスト生成、推論、視覚理解 | 2026-08-17 |
| Qwen3.8 シリーズの 27B ネイティブ視覚言語密モデルです。3.6-27B と比較して、テキストおよび視覚モダリティにおけるコーディングおよびオフィスシナリオの能力向上に重点を置いており、複雑なタスクをエンドツーエンドでより確実に完了し、信頼性の高い結果を提供できます。 |
テキスト生成、推論 | 2026-08-14 |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ Mixture-of-Experts (MoE) 大規模言語モデルです。ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。広範な高品質データでトレーニングされたこのモデルは、数学的・論理的推論、複雑な推論、プロフェッショナルなコード生成、詳細な長文ドキュメント分析において強力なパフォーマンスを発揮し、先端科学研究、複雑な企業ワークフロー、高度なエージェントアプリケーションなどの要求の厳しいシナリオに適しています。 |
テキスト生成 | 2026-08-12 |
| Qwen3.8-2.4T-A95B は、2026 年 8 月にリリースされた Qwen の最新フラッグシップシリーズのオープンソースバージョンです。総パラメーター数 2.4 兆、ステップごとに約 950 億がアクティブ化されるスパース MoE アーキテクチャを採用し、ハイブリッドアテンションメカニズムと組み合わせて、100 万トークンのコンテキストをサポートします。主要なベンチマーク:GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1、BabyVision 82.0、CodeArena グローバル #4。 |
動画生成 | 2026-08-06 |
| Wan3.0 は、参照、編集、複製、駆動などの複数の創造的機能を統一的にサポートするオールインワン動画生成モデルです。4 モーダル完全参照入力、最大 30 秒の動画生成をサポートし、ファイル、Web ページ、複雑な画像を解析できます。プロダクションレベルのキャラクター一貫性とリアルな音声と映像により、没入感のある視聴覚的インパクトを提供します。 |
画像生成 | 2026-08-04 |
| 明確な命令理解:最大 4.5k トークンの入力をサポートし、複雑な画像テキスト命令を一度に生成します。安定したテキストレンダリング:10px の小さなテキスト、12 言語、20 以上のフォントが鮮明に読み取れ、インフォグラフィックやインターフェイスにすぐに使用できます。便利なバッチ出力:ポスター、Web ページ、インターフェイスなどの日常的なタスクを低コストで一括生成でき、継続的な作成に最適です。Qwen-Image-3.0 Standard は、生成品質だけでなく、日常の創造的な利便性も追求し、画像生成を持続可能なコンテンツ生産性ツールにします。 |
テキスト生成、推論、視覚理解 | 2026-08-02 |
| 2.4 兆パラメーターの MoE フラッグシップで、コーディングとオフィス能力が包括的に飛躍し、数日間にわたって自律的にコーディングして完全なプロジェクトを提供できます。法律、金融、デザインなどの数百の専門的なタスクを処理し、1 回の対話でエンドツーエンドのプロダクションレベルの結果を提供します。ネイティブの視覚理解は、計画、実行、検証のパイプライン全体を通じて実行され、超長文ドキュメントと長尺動画の深層セマンティック解析をサポートします。長期タスクにおいて自律的計画とクローズドループ反復を実行し、継続的に進化します。 |
テキスト生成、推論 | 2026-08-01 |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
音声認識 | 2026-07-30 |
| Qwen-Audio-3.0-ASR-Flash-Streaming (リアルタイム)、Qwen-Audio-3.0-ASR-Flash-Filetrans (非リアルタイム)、および Qwen-Audio-3.0-ASR-Flash (非リアルタイム) モデルを追加しました:方言サポート:7 つの主要な中国語方言グループ (官話、呉語、湘語、贛語、客家語、閩語、粤語) と 20 以上の地域アクセントをサポートします。漢詩の最適化:漢詩の認識精度を向上させ、教育、文化、オーディオブックのシナリオに適しています。テキストの最適化:句読点予測とテキスト正規化を強化し、数字、日付、金額を自動的に標準形式に変換します。多言語拡張:中国語、英語、日本語、韓国語を含む 30 言語をサポートします。ホットワードとコンテキスト:ホットワード (プリコンパイルおよびオンザフライ) とコンテキスト入力をサポートし、ドメイン固有の用語の認識精度を向上させます。 |
テキスト生成、推論、視覚理解 | 2026-07-21 |
| Qwen3.7 ネイティブ視覚言語シリーズ Flash モデルは、3.6-Flash と比較してマルチモーダル理解とエージェント実行能力を包括的に強化しています。主な改善点には、基礎的なマルチモーダル能力の強化、オブジェクト認識の向上、実世界認識と空間的知性の改善が含まれます。Search Agent や CI Agent などのマルチモーダルエージェントシナリオは大幅にアップグレードされ、より安定したエンドツーエンドのタスク実行が可能になりました。マルチモーダルコーディング能力が最適化され、よりスムーズな Vibe コーディング体験を提供します。 |
画像生成 | 2026-07-20 |
| 豊富なコンテンツ:最大 4.5k トークンの入力と、画像内画像による高密度な情報レイアウトをサポートし、新聞、絵コンテ、メニュー、試験問題などの複雑なレイアウトを一度に生成できます。 本物のディテール:10px の小さなテキストの正確なレンダリングをサポートし、微細な表情、毛穴、髪の毛一本一本などの細かいディテールを鮮やかに再現し、実際の写真の品質に近づきます。 深い知識:12 言語と 20 以上のフォントのネイティブレンダリング、Web ページ、ゲーム、ライブストリームなどの主流インターフェイスのリアルなシミュレーションをサポートし、外部知識を完全に組み込みます。 Qwen-Image-3.0-Pro は「見栄えの良さ」だけでなく、「実用性」も追求しており、画像生成を真に展開可能な生産性ツールにしています。 |
音声合成、リアルタイム音声合成 | 2026-07-14 |
| Qwen-Audio-3.0-TTS-Plus は、高品質な音声生成シナリオ向けに設計されたパフォーマンス専有型音声合成モデルです。以前のバージョンと比較して、より多くの低リソース言語と中国語方言をサポートし、方言の信憑性を大幅に向上させ、感情、トーン、キャラクター、話速、音量、合成スタイルをより正確に制御するための自由形式の命令追従と詳細なタグ制御を強化しています。また、ノイズや残響のある音響条件下でもより堅牢になり、音質、明瞭度、解像度、全体的な表現力がさらに向上しています。Plus バージョンは、合成品質と詳細な表現力に重点を置いており、コンテンツ作成、オーディオブック、映画やビデオの吹き替え、ブランド音声デザイン、プレミアム音声サービスなど、音質、自然さ、表現力に対する要求が高いプロフェッショナルなシナリオに適しています。 |
リアルタイム音声合成 | 2026-07-14 |
| qwen-audio-3.0-tts-flash は、リアルタイムのインタラクティブなシナリオ向けに最適化されたパフォーマンス専有型音声合成モデルです。以前のバージョンと比較して、より多くの低リソース言語と中国語方言をサポートし、方言の信憑性を向上させ、感情、トーン、キャラクター、話速、音量、表現スタイルをより柔軟に制御するための自由形式の命令追従と詳細なタグ制御を強化しています。また、ノイズや残響のある音響条件下でもより堅牢になり、音質、明瞭度、全体的な表現力が向上しています。Flash バージョンはリアルタイム合成に重点を置いており、初回パケットレイテンシは 200 ms 以内に制御されているため、音声アシスタント、リアルタイム対話、インテリジェントカスタマーサービス、その他の低遅延インタラクティブアプリケーションに適しています。 |
リアルタイムチャット | 2026-07-14 |
| Qwen 3.0 リアルタイム音声モデル Standard Edition - Artificial Analysis Speech-to-Speech ベンチマークで世界第 1 位にランクされた次世代の全二重音声モデルです。モデルのインテリジェンスと全二重対話リズムのバランスを取り、自然なインタラクションと向上した応答品質を実現します。 |
リアルタイムチャット | 2026-07-14 |
| Qwen 3.0 リアルタイム音声対話モデル Flash Edition - Artificial Analysis Speech-to-Speech ベンチマークで世界第 1 位にランクされた次世代の全二重音声モデルです。高いインテリジェンスと最適化された全二重リズムを組み合わせ、低遅延 (並列推論、完全ストリーミング最適化) で応答速度に重点を置いた「速くて賢い」対話体験を実現します。 |
テキスト生成 | 2026-07-09 |
| GLM-5.2-Fast-Preview は、Zhipu AI の GLM-5.2 の高速バリアントで、1M のコンテキストと標準バージョンと同等の機能を備えています。推論最適化により 1.5~2 倍の出力 TPS を実現し、リアルタイムチャット、マルチターンエージェント、ストリーミングコード生成などの遅延の影響を受けやすいユースケースに適しています。 |
動画生成 | 2026-07-01 |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。このバージョンは 2026 年 6 月 12 日時点のスナップショットです。 |
動画生成 | 2026-07-01 |
| Wan2.7 参照動画生成、一貫性とパフォーマンスが向上しました。キャラクター、小道具、シーンの優れた安定性を提供します。最大 5 つの混合画像/動画入力のハイブリッド参照と音声の音色のクローンをサポートします。コアエンジンのアップグレードと合わせて、前例のない映画的な表現力を実現します。このバージョンは 2026 年 6 月 12 日時点のスナップショットです。 |
テキスト埋め込み | 2026-06-30 |
| Qwen LLM 基盤でトレーニングされたテキストランキングモデルは、入力クエリと候補ドキュメントの関連性ランキングを実行します。100 以上の言語と長文入力をサポートし、テキスト検索や RAG などのアプリケーションに適しています。そのパフォーマンスは、オープンソースの Qwen3-Rerank シリーズモデルに準拠しています。 |
画像生成 | 2026-06-25 |
| Qwen-Image-2.0 シリーズのフル機能モデルは、画像生成と編集を統合しています。1k トークンのコマンドサポートによるよりプロフェッショナルなテキストレンダリング機能、より繊細でリアルなテクスチャ、リアルなシーンの細やかな描写、そしてより強力なセマンティックな追従性を誇ります。フル機能バージョンは、2.0 シリーズで最も強力なテキストレンダリング機能とリアルなテクスチャを備えています。 |
音声認識 | 2026-06-17 |
| 2026 年 6 月に更新された Bailing ASR バージョンは、繁体字中国語の 7 大方言 (官話/呉語/湘語/贛語/客家語/閩語/粤語) を完全にサポートし、20 種類以上の地域官話アクセントに対応しています。漢詩のリズム、韻律、文学的表現の特徴に特化した最適化が施されており、詩の認識精度を向上させ、文化遺産、教育解説、オーディオブックに適しています。句読点予測とテキスト正規化能力が向上し、出力テキストが書き言葉の表現習慣により一致するようになりました。数字、日付、金額は自動的に標準形式に変換され、読みやすさと専門性が向上します。言語サポートは、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語の合計 30 言語に拡張されました。コンテキスト化機能をサポートし、最大 5 分間の音声を書き起こすことができます。 |
視覚理解 | 2026-06-16 |
| Qwen3.5-OCR は、ドキュメント解析、テキストローカライゼーション、キー情報抽出が強化されたアップグレード版 OCR モデルです。実世界のドキュメント (例:ID カード、運転免許証) の抽出パフォーマンスを大幅に向上させます。 |
動画生成 | 2026-06-16 |
| HappyHorse-1.1-T2V は、セマンティック理解、映画的なショットコントロール、ダイナミックなモーションレンダリングが向上した Text-to-Video 生成をサポートします。創造的な意図をより正確に捉え、より滑らかな動き、豊かなディテール、強力な視覚的一貫性、そしてより自然なキャラクターのアクション、シーンの雰囲気、物理的なダイナミクスを持つ高品質な動画を生成します。 |
動画生成 | 2026-06-16 |
| HappyHorse-1.1-R2V は、被写体、シーンスタイル、視覚的一貫性の安定性が大幅に向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像をサポートし、創造的な意図をより正確に理解して保持し、キャラクター、シーン、スタイル、映画的な動き全体でより強力な制御性と表現力を提供します。 |
動画生成 | 2026-06-16 |
| HappyHorse-1.1-I2V は、視覚品質、動的パフォーマンス、クリップ間の一貫性が向上した Image-to-Video 生成をサポートします。入力画像をより正確に理解し、創造的な意図を保持することで、肌の質感のリアリズム、クリップ間のキャラクター ID の一貫性、動きの滑らかさ、テキストレンダリングの安定性、視聴覚同期が大幅に改善され、より高いリアリズム、豊かなディテール、強力な全体的一貫性を持つ高品質な動画を生成します。 |
テキスト生成、推論 | 2026-06-16 |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
テキスト生成、推論、視覚理解 | 2026-06-15 |
| kimi-k2.7-code は、Kimi のこれまでで最もインテリジェントなコーディングモデルです。ロングコンテキストでより確実に命令に従い、より高い成功率でプログラミングタスクを完了します。テキスト、画像、動画の入力をサポートし、思考モード、会話、エージェントタスクにも対応しています。 |
テキスト生成、推論、視覚理解 | 2026-06-09 |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、5 月 20 日のスナップショットと比較して視覚モーダル理解が追加され、実世界のシーンを認識し、マルチモーダル対話型ハイブリッドエージェント機能をサポートします。このバージョンは 2026 年 6 月 8 日に取得されたスナップショットに基づいています。 |
テキスト生成、推論、視覚理解 | 2026-06-01 |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
音声合成 | 2026-06-01 |
| Fun Music 大規模モデルは、自由形式の歌詞や作曲要件に基づいて楽曲を作成し、男性/女性ボーカルの完全な中国語/英語の曲を生成します。曲は親しみやすく、感情的に進展し、人間のインスピレーションと LLM の能力の完璧な融合を表しています。 |
テキスト生成、推論 | 2026-05-21 |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
リアルタイム音声翻訳 | 2026-05-19 |
| 高精度、高応答性、堅牢な多言語対応の音声・映像同時通訳モデルである Qwen3.5-LiveTranslate-Flash のリアルタイムバージョンです。Qwen3.5-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3.5-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。60 以上の言語を理解し、29 の言語を話すことができます。 |
音声合成 | 2026-05-06 |
| 歌詞や創造的な要件から完全な中国語/英語の曲 (男性/女性ボーカル) を作成する音楽生成モデルで、人間のインスピレーションと AI の能力を融合させます。 |
動画生成 | 2026-04-26 |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。このバージョンは 2026 年 4 月 25 日時点のスナップショットです。 |
動画生成 | 2026-04-26 |
| Wan2.7 画像動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。このバージョンは 2026 年 4 月 25 日時点のスナップショットです。 |
動画生成 | 2026-04-26 |
| HappyHorse-1.0-V2V は、自然言語の命令による高度なビデオ編集をサポートします。最大 5 枚の参照画像を使用してビデオ要素の局所的または全体的な編集を可能にし、元の動きのダイナミクスを正確に保持して優れた表現力を実現します。 |
動画生成 | 2026-04-26 |
| HappyHorse-1.0-R2V は、被写体とシーンの参照における安定性が向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像を処理でき、創造的な意図を正確に保持して優れたパフォーマンスを提供します。 |
テキスト生成、推論 | 2026-04-24 |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ MoE 大規模モデルで、ネイティブで最大 100 万トークンのコンテキスト長をサポートします。膨大な高品質データコーパスでトレーニングされており、高度な数学的推論、複雑な論理的推論、専門的なコーディング、長文テキストの詳細な分析に優れており、最先端の研究、洗練されたオフィスワークフロー、高度な AI エージェントなどの要求の厳しいアプリケーションに適しています。 |
テキスト生成、推論 | 2026-04-24 |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-04-23 |
| Qwen3.5 ネイティブ視覚言語シリーズ Plus モデルは、2 月 15 日のスナップショットと比較して、エージェントコーディング能力が大幅に向上しています。推論速度も大幅に向上しており、知識保持、推論能力、ロングコンテキスト処理は高いレベルを維持しているため、複雑なエージェントベースのタスクに適しています。コーディングエージェント、生産ワークフロー、高スループットシナリオなどのアプリケーションに最適です。このバージョンは 2026 年 4 月 20 日に取得されたスナップショットに基づいています。 |
画像生成 | 2026-04-23 |
| フル機能の Qwen-Image-2.0 シリーズモデルは、画像生成と画像編集を統合し、1,000 トークンのプロンプトをサポートする強化されたテキストレンダリング、より洗練されたリアルなテクスチャ、詳細なフォトリアリスティックなシーンの描写、より強力なセマンティックな追従性を提供します。フル機能バージョンは、2.0 シリーズで最も強力なテキストレンダリングと最もリアルなテクスチャを提供します。 |
テキスト生成、推論、視覚理解 | 2026-04-22 |
| Qwen3.6 27B ネイティブ視覚言語密モデルは、3.5-27B バージョンを基盤としており、エージェントコーディング能力と強化された STEM 推論および推論スキルが主な改善点です。視覚モダリティでは、空間的知性、オブジェクトローカライゼーション、検出において著しい進歩を示しており、動画理解、ドキュメント OCR、視覚エージェント能力も着実に向上しています。 |
動画生成 | 2026-04-22 |
| HappyHorse-1.0-I2V は、非常にリアルな動的レンダリングを特徴とする画像動画生成を可能にします。テキストと画像の両方のセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
テキスト生成、推論、視覚理解 | 2026-04-21 |
| Kimi-k2.6 は、Kimi シリーズの最新のインテリジェントモデルで、強化されたロングコンテキストコード生成、改善された命令追従と自己修正能力を特徴とし、テキスト/画像/動画入力と複数の操作モードをサポートします。 |
動画生成 | 2026-04-21 |
| HappyHorse-1.0-T2V は、非常にリアルな動的レンダリングを特徴とするテキスト動画生成をサポートします。テキストのセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
テキスト生成、推論 | 2026-04-20 |
| Qwen3.6 シリーズで最大かつ最も高性能なバリアントである Max モデルが、プレビューバージョンとして利用可能になりました。現在、実験用に公開されているのはプレーンテキスト機能のみです。以前にリリースされた Qwen3-Max および Qwen3.6-Plus と比較して、このモデルは Vibe コーディング能力が向上し、コーディングエージェントの実行がより効率的になり、フロントエンド開発スキルが大幅に向上しています。さらに、ロングテール知識の保持もさらにアップグレードされています。 |
テキスト生成、推論、視覚理解 | 2026-04-16 |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成、推論、視覚理解 | 2026-04-16 |
| Qwen3.6 35B-A3B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートフレームワークを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3.5-35B-A3B と比較して、このモデルはエージェントコーディング能力、数学的およびコード推論能力、空間的知性、ならびにオブジェクトローカライゼーションおよびオブジェクト検出パフォーマンスが大幅に向上しています。 |
テキスト生成、推論 | 2026-04-14 |
| GLM-5.1 は、Zhipu AI によって開発されたモデルで、長期タスク向けに特別に設計されています。7,440 億のパラメーターを持ち、20 万トークンの超長コンテキストをサポートし、1 回の応答で最大 12 万 8,000 トークンを生成できます。GLM-5.1 は、論理的推論、長文理解、コード生成に優れており、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れた結果を出し、インテリジェントなヒューマンコンピュータインタラクション、エンタープライズソリューション、開発者支援などのアプリケーションに適しています。 |
動画生成 | 2026-04-03 |
| Wan2.7 動画編集は、プロンプトによる局所的および全体的な編集の両方をサポートします。画像参照を使用して要素をシームレスに置き換え、動き、特殊効果、カメラワークなどの複雑な動的プロセスを複製します。 |
動画生成 | 2026-04-03 |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。 |
動画生成 | 2026-04-03 |
| Wan2.7 参照動画生成、一貫性とパフォーマンスが向上しました。キャラクター、小道具、シーンの優れた安定性を提供します。最大 5 つの混合画像/動画入力のハイブリッド参照と音声の音色のクローンをサポートします。コアエンジンのアップグレードと合わせて、前例のない映画的な表現力を実現します。 |
動画生成 | 2026-04-03 |
| Wan2.7 画像動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。 |
画像生成 | 2026-04-01 |
| Wan2.7–image-pro は、テキストから画像、テキスト/画像から連続画像、画像編集、複数画像参照生成、インタラクティブ編集をサポートします。テキストレンダリング、被写体の一貫性、複雑な命令追従において強化されたパフォーマンスを提供します。 |
画像生成 | 2026-04-01 |
| Wan2.7 – 画像生成および編集は、テキストから画像、テキスト/画像から連続画像、画像編集、複数画像参照生成、インタラクティブ編集をサポートします。テキストレンダリング、被写体の一貫性、複雑な命令追従において強化されたパフォーマンスを提供します。 |
テキスト生成、推論、視覚理解 | 2026-04-01 |
| Qwen3.6 ネイティブ視覚言語 Plus シリーズモデルは、現在の最先端モデルに匹敵する卓越したパフォーマンスを示し、3.5 シリーズと比較して全体的な結果が大幅に向上しています。このモデルは、エージェントコーディング、フロントエンドプログラミング、Vibe コーディングなどのコード関連能力、およびマルチモーダル一般オブジェクト認識、OCR、オブジェクトローカライゼーションにおいて著しく強化されています。 |
リアルタイムオムニモーダル | 2026-03-30 |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen3-Omni の完全進化版として、60 以上の言語の音声入力、30 以上の言語の音声出力、制御可能な音声対話、Web 検索、複雑な FunctionCall 呼び出しをサポートし、インテリジェントなセマンティック割り込みインタラクション能力を備えています。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクティブ体験を提供します。 |
オムニモーダル | 2026-03-30 |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen 3-Omni の包括的な進化版として、10 時間以上の音声理解と 400 秒以上の 720P (1 FPS) 視聴覚理解と対話をサポートします。言語範囲をさらに拡大し、60 以上の言語の音声入力と 30 以上の言語の音声出力をサポートします。また、強力な構造化視聴覚理解能力も備えており、テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然で流暢なマルチモーダル理解とインタラクティブ体験を提供します。 |
リアルタイムオムニモーダル | 2026-03-30 |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen3-Omni の完全進化版として、60 以上の言語の音声入力、30 以上の言語の音声出力、制御可能な音声対話、Web 検索、複雑な FunctionCall 呼び出しをサポートし、インテリジェントなセマンティック割り込みインタラクション能力を備えています。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクティブ体験を提供します。 |
オムニモーダル | 2026-03-30 |
| Qwen 3.5-Omni は、Qwen の最新世代のマルチモーダル大規模モデルで、テキスト、画像、音声、視聴覚の理解とインタラクションをサポートします。Qwen 3-Omni の包括的な進化版として、10 時間以上の音声理解と 400 秒以上の 720P (1 FPS) 視聴覚理解と対話をサポートします。言語範囲をさらに拡大し、60 以上の言語の音声入力と 30 以上の言語の音声出力をサポートします。また、強力な構造化視聴覚理解能力も備えており、テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然で流暢なマルチモーダル理解とインタラクティブ体験を提供します。 |
音声認識 | 2026-03-05 |
| これは、Tongyi Lab の次世代エンドツーエンド音声認識モデルのリアルタイムバージョンで、独自の優れた音声技術に基づいており、卓越したコンテキスト認識と高精度の音声書き起こし機能を誇ります。エンドツーエンドアーキテクチャに基づき、Fun-ASR は革新的な RAG 技術を統合し、大規模なホットワードのカスタマイズ、禁止用語やモーダルパーティクルの自動フィルタリング、ITN 正規化、句読点予測などの多次元機能をサポートし、全体的な認識精度とコンテキストの関連性を大幅に向上させます。さらに、Fun-ASR は中国語と英語の柔軟な切り替えをサポートし、複数の地域の方言をカバーし、耐ノイズ性が強化されており、多様で複雑な環境に適応します。 |
音声認識 | 2026-03-03 |
| Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現し、言語を自動的に判断し、複数の言語の音声を正確に識別しながら、複雑な音声環境でも正確な書き起こしを保証します。このバージョンは 2026 年 2 月 10 日付のスナップショットです。 |
画像生成 | 2026-03-03 |
| フル機能の Qwen-Image-2.0 シリーズモデルは、画像生成と画像編集を統合し、1,000 トークンのプロンプトをサポートする強化されたテキストレンダリング、より洗練されたリアルなテクスチャ、フォトリアリスティックなシーンの詳細な描写、より強力なセマンティックな追従性を提供します。フル機能バージョンは、2.0 シリーズで最も強力なテキストレンダリングと最もリアルなテクスチャを提供します。このバージョンは 2026 年 3 月 3 日時点のスナップショットです。 |
画像生成 | 2026-03-03 |
| Qwen-Image-2.0 シリーズの高速化モデルは、画像生成と画像編集を統合し、1,000 トークンのプロンプトをサポートする強化されたテキストレンダリング機能、よりリアルなテクスチャ、細かく詳細なフォトリアリスティックなシーン、改善されたセマンティックな一貫性を提供します。高速化バージョンは、モデルのパフォーマンスと品質の最適なバランスを効果的に実現します。 |
音声合成 | 2026-02-27 |
| CosyVoice シリーズの高表現力音声合成モデルで、音声クローニングとデザイン機能が強化されています。話者の類似性を維持しながら自由形式の命令制御をサポートし、豊富な合成スタイルを提供します。初音節のレイテンシを削減し、発音精度を向上させ、韻律と音質を強化します。超自然な多言語 (中国語、英語、ドイツ語、フランス語、ロシア語、日本語、韓国語、ポルトガル語、タイ語、インドネシア語、ベトナム語) のリアルタイム音声合成を可能にします。 |
音声合成 | 2026-02-27 |
| CosyVoice シリーズのパフォーマンス専有型音声合成モデルで、音声クローニングとデザイン機能が強化されています。話者の類似性を維持しながら自由形式の命令制御をサポートし、豊富な合成スタイルを提供します。初音節のレイテンシを削減し、発音精度を向上させ、韻律と音質を強化します。超自然な多言語 (中国語、英語、ドイツ語、フランス語、ロシア語、日本語、韓国語、ポルトガル語、タイ語、インドネシア語、ベトナム語) のリアルタイム音声合成を可能にします。 |
テキスト生成、推論 | 2026-02-24 |
| MiniMax-M2.5 は、MiniMax のフラッグシップオープンソース大規模モデルで、大規模な強化学習を通じて数十万の実世界の複雑なシナリオでトレーニングされ、プログラミング、ツール呼び出し、検索、オフィス業務などの生産性シナリオで業界の最先端 (SOTA) を達成または上回っています。 |
テキスト生成、推論、視覚理解 | 2026-02-23 |
| Qwen3.5 ネイティブ視覚言語 Flash モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルタスクの両方でパフォーマンスが飛躍的に向上し、推論速度と全体的なパフォーマンスのバランスを取りながら高速な応答時間を提供します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 |
| Qwen3.5 シリーズ 35B-A3B は、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャで設計されたネイティブ視覚言語モデルで、より高い推論効率を実現しています。その全体的なパフォーマンスは Qwen3.5-27B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 |
| Qwen3.5 27B ネイティブ視覚言語密モデルは、線形アテンションメカニズムを組み込んでおり、推論速度とパフォーマンスのバランスを取りながら高速な応答時間を提供します。その全体的な能力は Qwen3.5-122B-A10B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 |
| Qwen3.5 122B-A10B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。全体的なパフォーマンスの観点から、このモデルは Qwen3.5-397B-A17B に次ぐものです。そのテキスト能力は Qwen3-235B-2507 を大幅に上回り、視覚能力は Qwen3-VL-235B を超えています。 |
テキスト生成 | 2026-02-19 |
| Qwen3 シリーズの新世代コード生成モデルは、Qwen3-Coder-Plus に近いパフォーマンスを提供しながら、さらに優れた機能を提供します。このモデルは、リポジトリレベルの理解に重点を置いて最適化されており、マルチターンのツールインタラクションをサポートし、エージェントコーディングツールとの互換性を強化しています。 |
テキスト生成、推論 | 2026-02-18 |
| GLM-5 は、コーディングとエージェントシナリオを対象とし、744B の基盤に非同期強化学習とスパースアテンションを組み込むことで、Claude Opus に近い能力で複雑なシステムエンジニアリングにおいてオープンソースの最先端 (SOTA) を達成しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 |
| Qwen3.5 ネイティブ視覚言語シリーズ Plus モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。さまざまなタスク評価において、3.5 シリーズは一貫して最先端の主要モデルと同等のパフォーマンスを示しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルの両方の能力で飛躍的な進歩を示しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 |
| Qwen3.5 シリーズ 397B-A17B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。言語理解、論理的推論、コード生成、エージェントベースのタスク、画像理解、動画理解、グラフィカルユーザーインターフェイス (GUI) インタラクションなど、幅広いタスクで最先端のモデルに匹敵する最先端のパフォーマンスを提供します。堅牢なコード生成とエージェント能力により、このモデルは多様なエージェントで強力な汎化能力を示します。 |
音声認識 | 2026-02-13 |
| Qwen3-ASR-Flash のリアルタイムバージョンは、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現し、言語を自動的に判断し、複数の言語の音声を正確に識別しながら、複雑な音声環境でも正確な書き起こしを保証します。このバージョンは 2026 年 2 月 10 日付のスナップショットです。 |
リアルタイム音声認識 | 2026-02-12 |
| 中国のコールセンターシナリオ向けに最適化された軽量リアルタイム北京語音声認識モデルで、多方言アクセントをサポートし、低サンプルレート/低 SNR 環境で低遅延、高精度の書き起こしを実現します。 |
音声合成 | 2026-02-10 |
| Qwen3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスによって設計された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 26 日のスナップショットバージョンです。 |
音声合成 | 2026-02-10 |
| Qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen-voice-enrollment サービスから複製された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声の音色を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 22 日のスナップショットバージョンです。 |
音声合成 | 2026-02-10 |
| Qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。Instruct モデルは自然言語を通じて合成効果を処理し、さまざまなコンテキストで非常に適切な感情的で表現力豊かな音声を保証します。現在、中国語と英語の両方の Instruct 調整用に 25 の音色をサポートしています。 |
テキスト生成、推論、視覚理解 | 2026-01-30 |
| Kimi-k2.5 は、Moonshot AI の最も多機能なモデルで、ネイティブのマルチモーダルアーキテクチャを備え、視覚/テキスト入力、思考/非思考モード、および対話とエージェントタスクの両方をサポートします。 |
動画生成 | 2026-01-29 |
| Wan2.6 参照動画生成フラッシュ、より速く、よりコスト効率の高い生成。指定された人物または任意のオブジェクトをリファレンスとして使用することをサポートし、外観と声の一貫性を正確に維持し、共同パフォーマンスのための複数キャラクター参照を可能にします。 |
テキスト埋め込み | 2026-01-29 |
| Qwen3-VL-Rerank は、豊富なマルチモーダル情報 (テキスト、画像、ビデオ) を深く理解する再ランキングモデルです。初期検索後、高度なクロスモーダル相関を適用して候補をインテリジェントに再ランキングし、最も関連性の高い結果を優先します。クロスモーダル検索の精度を向上させ、画像/ビデオ検索の精度を最適化し、画像クラスタリングの品質を向上させ、効率的な複雑なマルチモーダル検索とタグ付けを可能にします。 |
推論、視覚理解 | 2026-01-26 |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。 |
テキスト生成、推論 | 2026-01-23 |
| 2025 年 9 月 23 日時点のスナップショットと比較して、このリリースの Qwen-3 シリーズ Max モデルは、思考モードと非思考モードの効果的な統合を実現し、モデルの全体的なパフォーマンスが包括的かつ大幅に向上しています。思考モードでは、モデルは Web 検索、Web 情報抽出、コードインタープリターツールを同時にサポートし、遅く慎重な推論を行いながら外部ツールを活用することで、より複雑で困難な問題をより高い精度で解決できます。このバージョンは 2026 年 1 月 23 日に取得されたスナップショットに基づいています。 |
視覚理解 | 2026-01-22 |
| Qwen3 シリーズの small サイズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。2025 年 10 月 15 日に取得されたスナップショットと比較して、モデルの全体的なパフォーマンスは大幅に向上しています。一般的な視覚認識と推論の能力が向上し、セキュリティ、店舗内検査、機器モニタリング、写真ベースの問題解決などのさまざまなビジネスシナリオでの認識精度が著しく向上しています。このバージョンは 2026 年 1 月 22 日時点のスナップショットです。 |
マルチモーダル埋め込み | 2026-01-21 |
| Qwen3-VL-Embedding は、Qwen3-VL に基づく統一されたマルチモーダルベクトルモデルで、テキスト、画像、ビデオ (単一または混合モダリティ) 入力をサポートします。統一された表現ベクトルを出力し、クロスモーダル検索、画像/ビデオ検索、クラスタリング、複雑なマルチモーダル検索、タグ付けに適しています。 |
音声合成 | 2026-01-21 |
| qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。Instruct モデルは自然言語を通じて合成効果を処理し、さまざまなコンテキストで非常に適切な感情的で表現力豊かな音声を保証します。現在、中国語と英語の両方の Instruct 調整用に 25 の音色をサポートしています。このモデルは 2026 年 1 月 22 日にリリースされたスナップショットバージョンと同等です。 |
動画生成 | 2026-01-15 |
| Wan2.6 画像動画生成フラッシュ、より速く、よりコスト効率の高い生成。インテリジェントなショットスケジューリングにより、マルチカメラストーリーテリングが可能になり、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
画像生成 | 2026-01-15 |
| Max シリーズ Qwen の画像編集モデルは、より安定した多機能な編集機能を提供します。工業デザインと幾何学的推論の強化、キャラクターの一貫性の向上、オフセット問題の軽減、そしてより広範な画像編集機能のための LoRA 機能の統合が含まれます。 |
音声合成 | 2026-01-14 |
| Qwen3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスによって設計された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 15 日のスナップショットバージョンです。 |
音声合成 | 2026-01-14 |
| Qwen 3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen-voice-enrollment サービスから複製された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2026 年 1 月 15 日のスナップショットバージョンです。 |
テキスト生成 | 2026-01-13 |
| Qwen ロールプレイングモデルシリーズは、多言語の擬人化対話シナリオに特化して最適化されています。キャラクターの一貫性維持、コンテキストを意識した対話の進行、共感的な関与において高度な能力を発揮し、正確なパーソナライズされたキャラクターの具現化を可能にします。このバージョンは、日本語の言語ローカライゼーション (方言や敬語を含む)、人間らしいロールプレイングの信憑性、物語の一貫性制御、シナリオベースの認知インテリジェンスを大幅に強化しています。 |
画像生成 | 2026-01-09 |
| Qwen シリーズの画像生成モデルは、卓越したテキストレンダリング能力を誇り、複雑なテキストレンダリングだけでなく、幅広い生成および編集タスクにも優れています。2026 年 1 月 9 日に取得されたこのバージョンのスナップショットは、Qwen-Image-Max の蒸留・高速化されたバリアントであり、高品質な画像のより高速な生成を可能にします。 |
画像生成 | 2025年12月30日 |
| qwen の画像生成モデルの Max シリーズは、幅広い生成タスクで優れています。Plus シリーズと比較して、生成された画像の「AI らしさ」を大幅に低減し、リアリズムを向上させています。人物の被写体に対してよりリアルな素材の質感、より細かく詳細な自然なテクスチャ、そしてより視覚的に魅力的なテキストレンダリングを提供します。 |
テキスト生成、推論 | 2025-12-25 |
| Zhipu の最新フラッグシップで、コーディングとマルチステップ推論能力が強化され、長期タスク計画、ツール連携、没入型のライティング/ロールプレイングをサポートします。 |
画像生成 | 2025-12-18 |
| Z-Image-Turbo は、Artificial Analysis ベンチマークで世界 No.1 のオープンソース Text-to-Image モデルとしてトップに立った、非常に効率的な画像生成モデルです。わずか 60 億のパラメーターと 8 ステップの推論プロセスで、大規模な商用モデルによって生成される画像に匹敵するフォトリアリスティックな画像を生成し、中国語と英語のバイリンガルテキストレンダリング、複雑なセマンティック理解、多様なテーマ生成に優れています。 |
推論、視覚理解 | 2025-12-18 |
| Qwen3 シリーズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。9 月 23 日にリリースされたスナップショットと比較して、このバージョンは推論および分析タスク、スタイル制御において優れたパフォーマンスを提供し、同時により低いレイテンシと高速な応答速度を提供します。このバージョンは 2025 年 12 月 19 日に取得されたスナップショットに基づいています。 |
動画生成 | 2025-12-16 |
| Wan2.6 参照動画生成は、指定された人物または任意のオブジェクトをリファレンスとして使用することをサポートし、外観と声の一貫性を正確に維持し、共同パフォーマンスのための複数キャラクター参照を可能にします。 |
画像生成 | 2025-12-15 |
| Wan2.6 Text-to-Image、アップグレードされた視覚品質、美学、命令追従により、正確なスタイル制御、リアルなポートレート、長文理解、広範な歴史的/文化的 IP のカバレッジを提供し、高品質で表現力豊かな視覚生成を可能にします。 |
画像生成 | 2025-12-15 |
| Wan2.6 Image は、テキストと画像の共同推論、複数画像の創造的融合、商用レベルの一貫性、美的スタイル変換、フレーミングとライティングの正確な制御をサポートするオールラウンドな画像生成モデルで、画像生成における一貫性、制御性、表現力を大幅に向上させます。 |
画像生成 | 2025-12-15 |
| Qianwen シリーズの Image Editing Plus モデルは、10 月 30 日のスナップショットと比較して、キャラクターの一貫性、工業デザイン能力、幾何学的推論能力が強化されています。さらに、照明効果などの LoRA 機能を統合し、オフセット問題を効果的に軽減します。このバージョンは 2025 年 12 月 15 日に取得されたスナップショットに基づいています。 |
音声合成 | 2025-12-12 |
| Qwen 3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスによって設計された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対する優れた処理能力を示します。このモデルは 2025 年 12 月 16 日のスナップショットバージョンです。 |
音声合成 | 2025-12-12 |
| Qwen Voice-Design モデルは、Qwen Speech Model の音声デザインモデルシリーズです。簡単なテキスト記述だけで、適切な音声を迅速にデザインできます。qwen3-tts-vd-realtime モデルと組み合わせて使用すると、10 言語で音声をデザインして出力できます。さらに、合成された音声はテキストに基づいてトーンを適応的に調整し、複雑なテキスト合成に対して優れた処理能力を備えています。 |
リアルタイムオムニモーダル | 2025-12-04 |
| Qwen3-Omni-Flash マルチモーダル大規模モデルのリアルタイムバージョンは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。 |
オムニモーダル | 2025-12-04 |
| Qwen3-Omni-Flash マルチモーダル大規模モデルは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。 |
リアルタイム音声認識 | 2025-12-04 |
| Qwen3-LiveTranslate-Flash は、高精度、高応答性、堅牢な多言語リアルタイム音声・映像通訳モデルです。Qwen3-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。19 の言語を理解し、10 の言語を話すことができ、8 つの中国語方言もサポートしています。 |
動画生成 | 2025-12-03 |
| Wan2.6 テキスト動画生成、インテリジェントなショットスケジューリングはマルチショットストーリーテリングをサポートし、一貫した被写体、シーン、雰囲気を持つマルチショットの物語動画を生成し、最大持続時間は 15 秒です。より良い命令追従と改善された視覚的忠実度を提供します。 |
動画生成 | 2025-12-03 |
| Wan2.6 画像動画生成、インテリジェントなショットスケジューリングによりマルチカメラストーリーテリングが可能になり、より高品質な音声生成を提供し、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
テキスト生成、推論 | 2025-12-02 |
| DeepSeek-V3.2 は、スパースアテンションメカニズムである DeepSeek Sparse Attention を組み込んだモデルの公式リリースです。また、DeepSeek が推論をツール使用に統合した最初のモデルでもあり、推論対応と非推論の両方のツール呼び出しをサポートします。 |
テキスト生成、推論 | 2025-12-01 |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
音声合成 | 2025-11-27 |
| Qwen3-TTS-Flash モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-enrollment サービスによって複製された音声に対して高忠実度のリアルタイム音声合成を実行でき、同じ音声の音色で 11 言語の音声出力をサポートします。このモデルは膨大な量のデータでトレーニングされており、合成された音声はテキストに応じてトーンを適応的に調整でき、複雑なテキスト合成に対する優れた処理能力も備えています。このモデルはスナップショットバージョンとして提供されます。 |
音声合成 | 2025-11-27 |
| Qwen3-TTS-Flash-Realtime モデルは、Tongyi の最新のリアルタイム音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を実現します。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。広範なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自律的に調整し、複雑なコンテンツ合成に対して堅牢な能力を発揮します。 |
音声合成 | 2025-11-27 |
| Qwen3-TTS-Flash は、Tongyi の最新のオフライン音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を可能にします。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。大規模なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自動的に調整し、複雑なコンテンツの合成に対して堅牢な能力を発揮します。 |
音声合成 | 2025-11-27 |
| Qwen Voice-Enrollment モデルは、qwen 音声モデルの音声複製モデルシリーズです。わずか 5 秒以上の音声を使用して、非常に類似した音声を迅速に複製できます。qwen3-tts-vc-realtime モデルと組み合わせて使用すると、人の声を高忠実度で複製し、10 言語で音声を出力できます。さらに、合成された音声はテキストに応じてトーンを適応的に調整し、複雑なテキスト合成に対して優れた処理能力を備えています。 |
音声認識 | 2025-11-21 |
| 2026 年 4 月に更新された Fun ASR バージョンは、繁体字中国語の 7 大方言 (官話/呉語/湘語/贛語/客家語/閩語/粤語) を完全にサポートし、20 種類以上の地域官話アクセントに対応しています。漢詩のリズム、韻律、文学的表現の特徴に特化した最適化が施されており、詩の認識精度を向上させ、文化遺産、教育解説、オーディオブックに適しています。句読点予測とテキスト正規化能力が向上し、出力テキストが書き言葉の表現習慣により一致するようになりました。数字、日付、金額は自動的に標準形式に変換され、読みやすさと専門性が向上します。言語サポートは、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語の合計 30 言語に拡張されました。このバージョンは 2025 年 11 月 7 日にリリースされたスナップショットと同等です。 |
視覚理解 | 2025-11-20 |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
テキスト生成 | 2025-11-19 |
| Qwen-MT-Lite は、多言語翻訳に特化した Qwen モデルシリーズの大規模言語モデルです。32 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格で提供します。用語介入、フォーマット保持、ドメイン固有の翻訳などの機能を提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
音声認識 | 2025-11-17 |
| Qwen3-ASR-Flash の大容量ファイル書き起こしバージョンです。Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現します。言語を自動的に判断し、複数の言語の音声を正確に認識でき、複雑な音声環境でも正確な書き起こしを保証します。 |
リアルタイム音声認識 | 2025-11-17 |
| これは、Tongyi Lab の次世代エンドツーエンド音声認識モデルのリアルタイムバージョンで、独自の優れた音声技術に基づいており、卓越したコンテキスト認識と高精度の音声書き起こし機能を誇ります。エンドツーエンドアーキテクチャに基づき、Fun-ASR は革新的な RAG 技術を統合し、大規模なホットワードのカスタマイズ、禁止用語やモーダルパーティクルの自動フィルタリング、ITN 正規化、句読点予測などの多次元機能をサポートし、全体的な認識精度とコンテキストの関連性を大幅に向上させます。さらに、Fun-ASR は中国語と英語の柔軟な切り替えをサポートし、複数の地域の方言をカバーし、耐ノイズ性が強化されており、多様で複雑な環境に適応します。これは 2025 年 11 月 7 日にリリースされたスナップショットです。 |
音声認識 | 2025-11-17 |
| 2026 年 4 月に更新された Fun ASR バージョンは、繁体字中国語の 7 大方言 (官話/呉語/湘語/贛語/客家語/閩語/粤語) を完全にサポートし、20 種類以上の地域官話アクセントに対応しています。漢詩のリズム、韻律、文学的表現の特徴に特化した最適化が施されており、詩の認識精度を向上させ、文化遺産、教育解説、オーディオブックに適しています。句読点予測とテキスト正規化能力が向上し、出力テキストが書き言葉の表現習慣により一致するようになりました。数字、日付、金額は自動的に標準形式に変換され、読みやすさと専門性が向上します。言語サポートは、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語の合計 30 言語に拡張されました。これは 2025 年 11 月 7 日にリリースされたスナップショットです。 |
音声合成 | 2025-11-17 |
| 合成能力:CosyVoice-v3-Flash は、Tongyi Labs の CosyVoice シリーズの最新のパフォーマンス専有型音声合成モデルで、以前のバージョンと比較して自然さ、音色、韻律、感情表現が向上しています。このモデルは、リアルタイムのストリーミング音声合成をサポートしています。クローン能力:CosyVoice-v3-Flash は、Tongyi Labs の CosyVoice シリーズの最新の音声クローニングモデルでもあります。以前のバージョンと比較して、発音の精度と音色の類似性が向上し、あまり話されていない言語 (ドイツ語、スペイン語、フランス語、イタリア語、ロシア語、日本語) のサポートが追加されています。わずか 5~20 秒の参照音声から、非常に類似した自然な響きのカスタム音声を迅速に生成できます。 |
テキスト生成、推論 | 2025-11-10 |
| Kimi-k2-thinking は、Moonshot AI が開発した汎用エージェント推論モデルで、複雑な問題を解決するための深い推論とマルチステップのツール統合に特化しています。 |
テキスト生成 | 2025-11-06 |
| Qwen シリーズの大規模言語モデルである Qwen-MT-Flash は、Qwen 3 アーキテクチャで完全にアップグレードされ、パフォーマンスと翻訳品質が大幅に向上しました。92 の言語で迅速かつコスト効率の高い翻訳を提供し、用語介入、フォーマット保持、ドメイン固有の適応などの高度な機能をサポートします。速度、品質、コストの強力なバランスを必要とするアプリケーションに最適な選択肢です。 |
画像生成 | 2025-10-30 |
| qwen シリーズの画像編集 Plus モデルは、初期の Edit モデルに基づいて推論パフォーマンスとシステム安定性をさらに最適化し、画像生成と編集の応答時間を大幅に短縮します。また、1 回のリクエストで複数の画像を返すことをサポートし、ユーザーエクスペリエンスを大幅に向上させます。 |
リアルタイム音声認識 | 2025-10-27 |
| Qwen3-ASR-Flash のリアルタイムバージョンは、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現し、言語を自動的に判断し、11 の言語の音声を正確に識別しながら、複雑な音声環境でも正確な書き起こしを保証します。 |
推論、視覚理解 | 2025-10-21 |
| Qwen3-VL シリーズで最大の密モデルであり、その推論バージョンは Qwen3-VL-235B-Thinking に次ぐマルチモーダル推論能力を誇ります。STEM と数学の問題解決、一般的な画像および動画理解に優れ、マルチモーダルエージェント能力で最先端のパフォーマンスを達成しており、複雑なマルチモーダル推論タスクに最適です。 |
視覚理解 | 2025-10-21 |
| Qwen3-VL シリーズで最大の密モデルであり、非推論バージョンでは、Qwen3-VL-235B-Instruct に次ぐ全体的なパフォーマンスを提供します。ドキュメント認識と理解に優れ、強力な空間認識とオブジェクト識別能力を示し、2D 視覚検出と空間的推論で最先端のパフォーマンスを達成します。幅広い汎用シナリオでの複雑な知覚タスクに適しています。 |
テキスト生成、推論 | 2025-10-21 |
| GLM の新しいフラッグシップモデルで、4.5 を超える包括的な能力向上と 200K のコンテキストウィンドウを備えています。 |
推論、視覚理解 | 2025-10-14 |
| Qwen3 シリーズの small スケールの視覚理解モデルは、思考モードと非思考モードを効果的に統合し、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供しながら、高速な応答速度を維持します。拡張ビデオやドキュメントなどの超長コンテキスト、さまざまなドメインでの空間認識とオブジェクト認識をサポートする、画像/動画理解の包括的なアップグレードを特徴としています。2D/3D 視覚ローカライゼーション機能を備えており、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-09-30 |
| Qwen3-VL シリーズの 8B 密モデルの思考バージョンは、GPU メモリの消費が少なく、マルチモーダル理解と推論を実行できます。長い動画やドキュメントなどの非常に長いコンテキスト、2D/3D 視覚ローカライゼーションをサポートし、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力を備えています。 |
視覚理解 | 2025-09-30 |
| Qwen3-VL シリーズの 8B 密モデルの Instruct バージョンは、必要な GPU メモリが少なく、包括的にアップグレードされた画像/動画理解、長い動画やドキュメントなどの非常に長いコンテキストのサポート、空間認識、オブジェクト認識能力を提供し、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-09-30 |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの思考バージョンは、高速な応答速度と強化されたマルチモーダル理解および推論能力、視覚エージェント、および長い動画やドキュメントなどの非常に長いコンテキストのサポートを特徴としています。また、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力も誇り、複雑な実世界のタスクに適しています。 |
視覚理解 | 2025-09-30 |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの Instruct バージョンは、迅速な応答速度を提供し、長い動画やドキュメントなどの非常に長いコンテキストをサポートします。これには、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力、および 2D/3D 視覚ローカライゼーションが含まれており、複雑な実世界の課題に対応できます。 |
テキスト生成、推論 | 2025-09-30 |
| DeepSeek Sparse Attention (スパースアテンションメカニズム) を導入した実験バージョンで、長文テキストのトレーニングと推論効率の最適化と検証を探求します。 |
音声認識 | 2025-09-25 |
| Fun の多言語音声認識モデルは、31 以上の言語をサポートし、自由な言語切り替えを可能にするため、海外、特に東南アジアに展開するユーザーにとって最適な選択肢です。Fun-asr はこのモデルのアップグレード版です。Fun-asr への切り替えを推奨します。 |
画像生成 | 2025-09-23 |
| アップグレードされた Wan2.5 プレビュー画像編集モデル、新しくアップグレードされたモデルアーキテクチャは、命令制御による豊富な画像編集機能をサポートし、命令遵守が強化されています。また、高い一貫性を持つ複数画像参照生成を可能にし、優れたテキスト生成パフォーマンスを示します。 |
推論、視覚理解 | 2025-09-23 |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。このバージョンは 2025 年 9 月 23 日時点のスナップショットです |
推論、視覚理解 | 2025-09-23 |
| Qwen3 シリーズ VL モデルは、マルチモーダル推論能力が大幅に強化されており、特に STEM と数学的推論のためにモデルを最適化することに重点を置いています。視覚認識能力は包括的に改善され、OCR 機能は大幅にアップグレードされました。 |
視覚理解 | 2025-09-23 |
| Qwen3 シリーズ VL モデルは、視覚コーディングや空間知覚などの分野で包括的にアップグレードされました。その視覚認識能力は大幅に向上し、超長尺動画の理解をサポートし、OCR 機能は大幅に強化されました。 |
テキスト生成、推論 | 2025-09-23 |
| Qwen 3 シリーズ Max モデルは、プレビューバージョンと比較して、エージェントプログラミングとツール呼び出しにおいて専門的なアップグレードが行われています。今回正式にリリースされたモデルは、その分野で最先端 (SOTA) のパフォーマンスを達成しており、より複雑なシナリオで動作するエージェントの要求により適しています。 |
リアルタイム音声翻訳 | 2025-09-23 |
| 高精度、高応答性、堅牢な多言語対応の音声・映像同時通訳モデルである Qwen3-LiveTranslate-Flash のリアルタイムバージョンです。Qwen3-Omni の強力なインフラ、膨大なマルチモーダルデータ、クロス言語・クロスモーダルアライメント、視覚強調技術を活用し、Qwen3-LiveTranslate-Flash はオフラインとリアルタイムの両方で音声・映像翻訳機能を提供します。19 の言語を理解し、8 つの中国語方言を含む 10 の言語を話すことができます。 |
テキスト生成 | 2025-09-23 |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。これは 2025 年 9 月 23 日のスナップショットです。以前のバージョン (7 月 22 日のスナップショット) と比較して、下流のタスクパフォーマンスとツール呼び出しにおける堅牢性が向上し、コードセキュリティも強化されています。 |
視覚理解 | 2025-09-23 |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
画像生成 | 2025-09-23 |
| Qwen シリーズで初めて、複雑なテキストレンダリングと正確な画像編集において大きな進歩を遂げた画像生成基盤モデルです。実験では、画像生成と編集の両方で強力な一般能力が示され、特に中国語のテキストレンダリングで卓越したパフォーマンスを発揮します。 |
リアルタイム音声認識 | 2025-09-23 |
| これは、Tongyi Lab の次世代エンドツーエンド音声認識モデルのリアルタイムバージョンで、独自の優れた音声技術に基づいており、卓越したコンテキスト認識と高精度の音声書き起こし機能を誇ります。エンドツーエンドアーキテクチャに基づき、Fun-ASR は革新的な RAG 技術を統合し、大規模なホットワードのカスタマイズ、禁止用語やモーダルパーティクルの自動フィルタリング、ITN 正規化、句読点予測などの多次元機能をサポートし、全体的な認識精度とコンテキストの関連性を大幅に向上させます。さらに、Fun-ASR は中国語と英語の柔軟な切り替えをサポートし、複数の地域の方言をカバーし、耐ノイズ性が強化されており、多様で複雑な環境に適応します。 |
画像生成 | 2025-09-22 |
| 最初の Qwen 画像編集モデルは、Qwen-Image のテキストレンダリングを編集タスクに拡張します。正確なバイリンガル (中国語/英語) テキスト編集、視覚とセマンティクスの両方の編集、および強力なクロスベンチマークパフォーマンスを提供します。 |
動画生成 | 2025-09-19 |
| アップグレードされた Wan2.5 プレビューテキスト動画モデル、新しくアップグレードされたモデルアーキテクチャは、視覚と同期した音声生成をサポートし、10 秒の長尺動画生成を可能にし、強化された命令遵守、改善されたモーション能力、優れた画質を提供します。 |
画像生成 | 2025-09-19 |
| アップグレードされた Wan2.5 プレビューテキスト画像モデル、新しくアップグレードされたモデルアーキテクチャは、視覚的な美学、デザイン感性、リアルな質感を大幅に向上させます。正確な命令遵守に優れ、英語、中国語、およびあまり一般的でない言語でテキストを巧みに生成し、複雑な構造化された長文、チャート、建築図の生成をサポートします。 |
動画生成 | 2025-09-19 |
| アップグレードされた Wan2.5 プレビュー画像動画モデル、新しくアップグレードされたモデルアーキテクチャは、視覚と同期した音声生成をサポートし、10 秒の長尺動画生成を可能にし、強化された命令遵守、改善されたモーション能力、優れた画質を提供します。 |
動画生成 | 2025-09-19 |
| wan2.2-animate-move は、キャラクターアニメーション生成モデルです。ユーザーはキャラクターの写真と参照パフォーマンスビデオをアップロードするだけで、モデルはビデオから表情とアクションを画像内のキャラクターに転送し、高忠実度のアニメーションビデオを生成します。 |
動画生成 | 2025-09-19 |
| wan2.2-animate-mix は、キャラクター置換モデル製品です。キャラクターの写真とパフォーマンスビデオをアップロードすることで、ユーザーは元のビデオのキャラクターを写真のキャラクターに正確に置き換えることができ、元のビデオのシーン、照明、色調などの環境の詳細を完全に保持します。 |
リアルタイムオムニモーダル | 2025-09-17 |
| Qwen3-Omni-Flash マルチモーダル大規模モデルのリアルタイムバージョンは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。 |
オムニモーダル | 2025-09-17 |
| Qwen3-Omni-Flash マルチモーダル大規模モデルは、Thinker–Talker 混合エキスパート (MoE) アーキテクチャに基づいており、テキスト、画像、音声、ビデオの効率的な理解と音声生成をサポートします。119 の言語のテキストと 20 の言語の音声で対話でき、人間のような音声を生成して正確なクロスリンガルコミュニケーションを実現します。このモデルは、強力な命令追従とシステムプロンプトのカスタマイズ機能を誇り、会話スタイルやキャラクター設定に柔軟に対応します。テキスト作成、音声アシスタント、マルチメディア分析などのシナリオで広く使用され、自然でスムーズなマルチモーダルインタラクション体験を提供します。このバージョンは 2025 年 9 月 15 日のスナップショットバージョンです。 |
音声認識 | 2025-09-17 |
| Qwen3-Omni-30b-a3b-Captioner は、複雑で変化する音声シナリオで正確かつ包括的なコンテンツ記述を生成するように設計された強力な詳細な音声分析モデルです。複雑な音声や環境音から音楽、映画、テレビの効果音まで、さまざまな音声コンテンツを自動的に解析して記述でき、マルチソースおよび混合環境でも安定した信頼性の高い出力を維持できます。 |
音声合成 | 2025-09-16 |
| Qwen3-TTS-Flash-Realtime-2025-09-18 モデルは、Tongyi の最新のリアルタイム音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を実現します。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。広範なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自律的に調整し、複雑なコンテンツ合成に対して堅牢な能力を発揮します。このモデルはスナップショットバージョンとして提供されます。 |
音声合成 | 2025-09-16 |
| Qwen 3-TTS-Flash-2025-09-18 は、Tongyi の最新のオフライン音声合成基盤モデルで、17 の表現力豊かな音声を特徴とし、低遅延で高安定性の音声合成を可能にします。言語間で一貫した音声特性を持つ多言語および方言出力をサポートします。大規模なデータセットでトレーニングされたこのシステムは、テキストのセマンティクスに基づいて声のトーンを自動的に調整し、複雑なコンテンツの合成に対して堅牢な能力を発揮します。このモデルはスナップショットバージョンとして提供されます。 |
テキスト生成、推論 | 2025-09-11 |
| Qwen3 ベースのオープンソース思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Thinking-2507) よりも改善された命令追従と合理化された要約応答を提供します。 |
テキスト生成 | 2025-09-11 |
| Qwen3 を搭載したオープンソースの非思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Instruct-2507) よりも優れた中国語テキスト理解、強化された論理的推論、およびテキスト生成タスクにおける能力の向上を示しています。 |
テキスト生成、推論 | 2025-09-11 |
| 2025 年 9 月 11 日のスナップショットとして、このリリースは思考モードでの命令追従の強化と合理化された要約応答を特徴としています。非思考モードは、優れた中国語テキスト理解と強化された論理的推論能力を提供します。このモデルは 1M のコンテキスト長をサポートし、段階的価格設定が適用されます。 |
音声認識 | 2025-09-08 |
| Qwen3-ASR-Flash は、大規模言語モデルに基づく高精度、インテリジェント、堅牢な多言語音声認識モデルです。強力な基盤モデル、膨大な量のテキストおよびマルチモーダルデータ、数千万時間の音声データを活用し、Qwen3-ASR-Flash は高精度の音声認識を実現します。言語を自動的に判断し、11 の言語の音声を正確に認識でき、複雑な音声環境でも正確な書き起こしを保証します。 |
テキスト生成、推論 | 2025-09-05 |
| Qwen 3 シリーズの Max モデルのプレビューバージョンで、思考モードと非思考モードの効果的な統合を実現しています。思考モードでは、インテリジェントなエージェントプログラミング、常識的な推論、数学、科学、一般領域にわたる推論などの能力が大幅に向上しています。 |
音声合成 | 2025-09-03 |
| クローン能力:CosyVoice-v3-plus は、Tongyi Lab の CosyVoice シリーズの最新の大規模音声クローニングモデルです。優れた音質とクローニング忠実度を提供し、プロフェッショナルなシナリオに最適です。わずか 5~20 秒の参照音声で、非常に類似した自然な響きのカスタム音声を迅速に生成できます。合成能力:CosyVoice-v3-plus は、Tongyi Lab の CosyVoice シリーズの最新の大規模音声合成モデルです。音質と表現力が向上しており、プロフェッショナルなシナリオに最適です。このモデルは、リアルタイムのストリーミング音声合成をサポートしています。 |
動画生成 | 2025-08-25 |
| wan2.2-s2v の補助モデルで、入力されたポートレート画像が必要な仕様に適合しているかを検証し、wan2.2-s2v による動画生成との互換性を確保します。 |
動画生成 | 2025-08-25 |
| 入力されたキャラクター画像と音声ファイルから、動的なキャラクター動画 (話す/歌う/演じる) を作成する高品質な動画生成モデルです。 |
テキスト生成、推論 | 2025-08-23 |
| 思考モードと非思考モードの両方をサポートするハイブリッド推論アーキテクチャモデルで、より高い推論効率と強力なエージェント能力を備えています。 |
画像生成 | 2025-08-22 |
| Qwen-MT-Image は画像翻訳に特化しており、11 言語 (中国語、英語、日本語など) の画像をターゲット言語に変換します。レイアウトとコンテンツを正確に保持し、用語定義、禁止用語フィルタリング、製品検出などのカスタム機能をサポートして、柔軟で正確な画像ローカライズを実現します。 |
テキスト生成 | 2025-08-22 |
| Qwen-Deep-Research は、複雑な研究タスクのための高度なエージェントシステムで、マルチステップ推論とグローバル計画能力を備えています。インターネット検索などのツールを活用して、詳細なタスク分解、推論、分析を行い、最終的に追跡可能で論理的に厳密な研究レポートを生成します。 |
音声認識 | 2025-08-22 |
| これは、北京語、英語、日本語に重点を置いた新世代の大規模音声認識モデルです。幅広い地域の方言をサポートし、耐ノイズ性が強化されており、多様で複雑な環境に適応するため、中国のユーザーに最も推奨されます。これは 2025 年 8 月 25 日にリリースされたスナップショットです。 |
画像生成 | 2025-08-13 |
| Qwen シリーズで初めて、複雑なテキストレンダリングと正確な画像編集において大きな進歩を遂げた画像生成基盤モデルです。実験では、画像生成と編集の両方で強力な一般能力が示され、特に中国語のテキストレンダリングで卓越したパフォーマンスを発揮します。 |
テキスト生成 | 2025-08-05 |
| Qwen3 に基づくこのコード生成モデルは、Qwen3-Coder-Plus のコーディングエージェント能力を継承し、マルチターンのツールインタラクションをサポートします。リポジトリレベルの理解とツール呼び出しの安定性向上に重点を置いた最適化が特徴です。 |
テキスト生成、推論 | 2025-08-05 |
| Qwen3 Flash モデルは、思考モードと非思考モードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令追従とテキスト理解において大幅な向上を示します。1M のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで請求されます。 |
テキスト生成 | 2025-07-31 |
| Qwen3 ベースのコード生成モデルで、Qwen3-Coder-480B-A35B-Instruct のコーディングエージェント能力を継承しています。同規模でコード能力は SOTA に達しています。 |
テキスト生成、推論 | 2025-07-31 |
| バランスの取れたパフォーマンスに最適化された Qwen シリーズモデルで、Qwen-Max と Qwen-Turbo の中間の推論効率を提供し、中程度の複雑なタスクを効果的に処理するように設計されています。この動的に更新されるバージョンは、事前の通知なしに変更を実装します。 |
テキスト生成、推論 | 2025-07-30 |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、論理、数学、科学、コードなどの複雑な思考タスクに優れています。命令追従、テキスト理解、多言語翻訳能力が大幅に向上しました。 |
テキスト生成、推論 | 2025-07-30 |
| Qwen3 シリーズ Plus モデルは、思考モードと非思考モードを統合し、対話中にモードを切り替えることができます。以前のバージョンと比較して、中国語と英語の能力およびツール呼び出しに特化した機能強化が追加されています。これは 2025 年 7 月 28 日のスナップショットで、初めて 1M のコンテキスト長をサポートし、段階的価格設定を使用します。 |
テキスト生成 | 2025-07-29 |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、中国語、英語、および全体的な多言語一般能力が大幅に向上しています。主観的な自由回答タスクに最適化されており、ユーザーの好みに著しく合致し、より役立つ応答を提供します。 |
動画生成 | 2025-07-28 |
| アップグレードされた Wan 2.2 Plus テキスト動画生成モデルは、安定したスイーピング複合動作、映画的な視覚制御、より強力なプロンプト追従、リアルな世界の再現により、より高品質な結果を提供します。 |
画像生成 | 2025-07-28 |
| アップグレードされた Wan 2.2 Plus テキスト画像生成モデルは、創造性、安定性、リアリズムが向上した、より豊かな画像ディテールを提供します。また、より強力なプロンプト追従と複数のスタイルのネイティブサポートも特徴です。最大 200 万ピクセルの生成とプロンプト強化もサポートされています。 |
画像生成 | 2025-07-28 |
| アップグレードされた Wan 2.2 Flash テキスト画像生成モデルは、創造性、安定性、リアリズムが向上し、より高速な速度を提供します。また、より強力なプロンプト追従と複数のスタイルのネイティブサポートも特徴です。最大 200 万ピクセルの生成とプロンプト強化もサポートされています。 |
動画生成 | 2025-07-28 |
| アップグレードされた Wan 2.2 Plus 画像動画生成モデルは、最適化された安定性、より強力なプロンプト追従、テキスト、ポートレート、製品の一貫性の向上、正確なショットコントロールにより、より高品質な結果を提供します。 |
テキスト生成、推論 | 2025-07-25 |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、論理能力、一般能力、知識強化、創造性が大幅に向上しており、高難易度で強力な思考を要するシナリオに適しています。 |
テキスト生成 | 2025-07-23 |
| Qwen-Doc-Turbo は、ドキュメントから正確な情報を迅速に抽出し、タグ付け、分類、コンテンツモデレーション、要約をサポートします。 |
テキスト生成 | 2025-07-22 |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。 |
テキスト生成 | 2025-07-22 |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデル。コード能力はオープンソースの SOTA に達しています。 |
テキスト生成 | 2025-07-22 |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、主観的な創造性とモデルの安全性にわずかな改善が見られます。 |
テキスト生成 | 2025-07-22 |
| Qwen-MT-Turbo は、多言語翻訳に特化した Qwen モデルシリーズ内の大規模言語モデルです。92 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格帯で提供します。また、用語介入、フォーマット保持、ドメイン固有の翻訳などの機能も提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
テキスト生成 | 2025-07-22 |
| Qwen シリーズのフラッグシップ翻訳モデルである Qwen-MT-Plus は、Qwen3 アーキテクチャで完全にアップグレードされました。92 の言語をサポートし、非常に正確で自然な響きの翻訳を提供します。コンテキスト理解、用語制御、フォーマット保持における高度な能力により、特に専門分野において従来のモデルよりも優れた選択肢となります。 |
リアルタイム音声合成 | 2025-07-16 |
| Qwen-TTS-Realtime は、双方向コンテキスト認識を備えた Qwen シリーズの音声合成モデルです。多音声、方言、長文の双方向ストリーミングの低遅延、高忠実度生成を可能にします。 |
テキスト生成、推論 | 2025-07-16 |
| Qwen3 シリーズの Plus モデルは、思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。これは 2025 年 7 月 14 日のスナップショットです。以前のバージョンと比較して、非思考モードでの中国語と英語の両方の能力が大幅に向上し、ツール呼び出し能力も強化されています。 |
テキスト生成 | 2025-07-16 |
| Kimi-K2 は、Moonshot の中国初のオープンソース兆パラメーター MoE モデルで、32B のアクティブ化パラメーターを備え、卓越したコーディングとツール呼び出し能力を特徴としています。 |
音声合成 | 2025-06-26 |
| Qwen-TTS は、Qwen シリーズ初の音声合成モデルで、中国語、英語、および混合入力をサポートします。テキストに基づいて出力トーンを適応的に調整し、自然な音質を提供し、ストリーミング出力をサポートします。 |
テキスト生成、推論 | 2025-06-24 |
| Qwen3 シリーズの Turbo モデルです。思考モードと非思考モードを効果的に統合し、会話中にモードを切り替えることができます。その推論能力は、より小さなパラメーターサイズで QwQ-32B に匹敵し、一般能力は Qwen2.5-Turbo を大幅に上回り、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-06-24 |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
推論 | 2025-06-18 |
| トレーニング後の広範な強化学習によって強化された大規模言語モデルで、最小限のラベル付きデータで強力な推論能力を実現します。数学、コーディング、自然言語推論タスクで優れたパフォーマンスを発揮します。 |
視覚理解 | 2025-06-13 |
| Qwen-VL-Plus は、大規模視覚言語モデルの強化版です。ディテール認識とテキスト認識能力を大幅に向上させ、100 万ピクセルを超える解像度と任意の縦横比仕様の画像をサポートします。このモデルは、幅広い視覚タスクで卓越したパフォーマンスを発揮します。 |
テキスト埋め込み | 2025-06-05 |
| 一般テキストベクトル V4 バージョンは、Tongyi Lab が Qwen3 に基づいて開発した多言語テキストベクトルモデルです。V3 バージョンと比較して、テキスト検索、クラスタリング、分類タスクのパフォーマンスを大幅に向上させます。MTEB 多言語、中英、コード検索などの評価タスクで 15% から 40% の改善を達成しています。さらに、64 から 2048 の範囲でユーザー定義のベクトル次元をサポートします。 |
推論 | 2025-06-04 |
| トレーニング後の広範な強化学習によって強化された大規模言語モデルで、最小限のラベル付きデータで強力な推論能力を実現します。数学、コーディング、自然言語推論タスクで優れたパフォーマンスを発揮します。 |
推論、視覚理解 | 2025-06-03 |
| Qwen QVQ 視覚的推論モデル Plus バージョンは、視覚入力と Chain-of-Thought 出力をサポートし、数学、プログラミング、視覚分析、作成、および一般タスクにおいて強化された能力を備えています。 |
音声合成 | 2025-05-27 |
| 大規模な事前学習済み言語モデルを通じてテキスト理解と音声生成を組み合わせた生成音声合成モデルで、リアルタイムのストリーミング音声合成をサポートします。 |
視覚理解 | 2025-05-26 |
| Qwen-VL-Max は、Qwen シリーズの大規模視覚言語モデルです。Plus バージョンと比較して、視覚的推論能力と命令追従能力をさらに強化し、より高いレベルの視覚認識と認知を提供します。より複雑なタスクで最適なパフォーマンスを発揮します。 |
動画生成 | 2025-05-14 |
| Wanxiang 2.1 - ビデオ編集統一モデル - Plus。ローカライズされた編集、ビデオ再描画、背景拡張、持続時間延長、および参照ベースの生成をサポートします。テキスト、画像、またはビデオによるマルチモーダル制御を可能にします。 |
リアルタイムオムニモーダル | 2025-05-08 |
| Qwen の新しい大規模マルチモーダル理解・生成モデルのリアルタイムバージョンで、リアルタイムの音声対話シナリオに適しています。テキスト、画像、ビデオが混在する音声の理解をサポートし、音声とテキストを同時にストリームで生成でき、4 つの自然なトーンを提供します。 |
テキスト生成、推論 | 2025-04-29 |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-7B を大幅に上回ります。 |
テキスト生成、推論 | 2025-04-29 |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-32B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-04-29 |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、より小さなパラメーターサイズで QwQ-32B に匹敵し、一般能力は Qwen2.5-14B を大幅に上回り、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-04-29 |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-72B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-04-29 |
| Qwen3 シリーズの Plus モデルは、思考モードと非思考モードを効果的に統合し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-Plus を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。このモデルは 2025 年 4 月 28 日のスナップショットです。 |
テキスト生成、推論 | 2025-04-28 |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-14B を大幅に上回ります。 |
画像生成 | 2025-04-28 |
| 高品質なバーチャル試着画像生成モデルで、aitryon と比較して画像の明瞭度、衣服の質感の詳細、ロゴの再構築が強化された試着効果を生成します。生成時間が長くなるため、時間に制約のないシナリオに適しています。 |
視覚理解 | 2025-04-23 |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
動画生成 | 2025-04-21 |
| Wanxiang 2.1 - キーフレームからビデオへ - Plus。2 つの入力画像からスムーズなトランジションビデオを生成します。複雑な大規模な動き、物理法則の遵守、多様な芸術的スタイル、映画レベルの視覚品質をサポートします。命令追従能力が強化され、視覚的なディテールがより豊かになりました。 |
音声合成 | 2025-04-20 |
| Qwen-TTS は、Qwen シリーズ初の音声合成モデルで、中国語、英語、および混合入力をサポートします。テキストに基づいて出力トーンを適応的に調整し、自然な音質を提供し、ストリーミング出力をサポートします。 |
オムニモーダル | 2025-03-27 |
| 新しいマルチモーダル理解・生成モデルで、テキスト、画像、音声、ビデオ入力、および混合入力理解をサポートします。テキストと音声を同時にストリームでき、マルチモーダルコンテンツ理解の速度が大幅に向上しています。さらに、4 つの自然な対話トーンを提供します。このモデルは 2025 年 3 月 26 日のスナップショットで、2025 年 1 月 19 日のスナップショットに比べて視覚能力が大幅に向上しています。 |
オムニモーダル | 2025-03-26 |
| Qwen2.5 に基づいてトレーニングされた新しいマルチモーダル理解・生成モデルです。テキスト、画像、音声、ビデオ、および混合入力理解をサポートし、テキストと音声のストリームを同時に生成でき、マルチモーダルコンテンツ理解の速度を大幅に向上させます。4 つの自然なトーンを提供します。 |
推論、視覚理解 | 2025-03-26 |
| Tongyi Qianwen QVQ 視覚的推論モデルは、視覚入力と Chain-of-Thought 出力をサポートし、数学、プログラミング、視覚分析、作成、および一般タスクにおいてより強力な能力を発揮します。 |
画像生成 | 2025-03-25 |
| プリセットおよびコマンドベースのタスクをサポートする画像編集モデルで、グローバル/ローカル編集 (スタイル変換、インペインティング、拡張、超解像技術) および参照ベースの生成が含まれます。 |
テキスト生成 | 2025-03-20 |
| Qwen シリーズのロールプレイングモデルです。これは動的に更新されるバージョンであり、モデルの更新については事前に通知が提供されます。擬人化ロールプレイングに適しており、事前定義されたキャラクターの指示に従う、会話を進める、積極的な傾聴と共感を示す能力が最適化されています。さらに、パーソナライズされたキャラクターの深い復元をサポートします。 |
テキスト埋め込み | 2025-03-20 |
| セマンティック検索と RAG のための多言語テキスト再ランキングモデルで、クエリへの関連性によって候補ドキュメントをランキングします。 |
テキスト生成 | 2025-03-19 |
| Qwen-Long は、超長コンテキスト処理用に設計された大規模言語モデルで、中国語、英語、その他の言語をサポートします。対話で最大 1,000 万トークン (約 1,500 万文字または 15,000 ドキュメントページ) を処理します。ドキュメントサービスと統合されており、テキストファイル (TXT、DOCX、PDF、XLSX、EPUB、MOBI、MD、CSV) および画像ファイル (BMP、PNG、JPG/JPEG、GIF、PDF スキャン) の解析と対話をサポートします。注:HTTP リクエストは最大 1M トークンをサポートします。より長いコンテンツにはファイル送信を推奨します。 |
オムニモーダル | 2025-03-17 |
| 新しいマルチモーダル理解・生成モデルで、テキスト、画像、音声、ビデオ入力、および混合入力理解をサポートします。テキストと音声を同時にストリームでき、マルチモーダルコンテンツ理解の速度が大幅に向上しています。さらに、4 つの自然な対話トーンを提供します。 |
推論 | 2025-03-05 |
| Qwen QwQ 推論モデルの強化版で、Qwen2.5 モデルでトレーニングされ、強化学習によって推論能力が大幅に向上しました。数学とコーディングのコアメトリック (例:AIME 24/25、LiveCodeBench) および一部の一般メトリック (例:IFEval、LiveBench) は、DeepSeek-R1 のフルバージョンレベルに達しています。 |
リアルタイム音声翻訳 | 2025-03-04 |
| 10 言語 (中国語/英語/日本語/韓国語を含む) の高精度リアルタイム書き起こしとクロスリンガル翻訳を提供する多言語音声テキスト変換および翻訳モデルです。 |
動画生成 | 2025-02-27 |
| 画像を複雑な動きと映画的な美学を持つ動的なビデオに変換する Image-to-Video Generation-Turbo モデルで、より高速な生成速度と強化された命令遵守を特徴とします。 |
オムニモーダル | 2025-02-14 |
| 新しいマルチモーダル理解・生成モデルで、テキスト、画像、音声、ビデオ入力、および混合入力理解をサポートします。テキストと音声を同時にストリームでき、マルチモーダルコンテンツ理解の速度が大幅に向上しています。さらに、4 つの自然な対話トーンを提供します。 |
テキスト生成 | 2025-02-05 |
| Qwen2.5-Math-7B に基づく蒸留大規模言語モデルで、DeepSeek R1 の出力を使用してトレーニングされています。 |
テキスト生成 | 2025-02-05 |
| Qwen2.5-32B に基づく蒸留大規模言語モデルで、DeepSeek R1 の出力を使用してトレーニングされています。 |
テキスト生成 | 2025-02-05 |
| Qwen2.5-14B に基づく蒸留大規模言語モデルで、DeepSeek R1 の出力を使用してトレーニングされています。 |
テキスト生成 | 2025-02-05 |
| Qwen2.5-Math-1.5B に基づく蒸留大規模言語モデルで、DeepSeek R1 の出力を使用してトレーニングされています。 |
テキスト生成 | 2025-02-05 |
| Llama-3.1-70B に基づく蒸留大規模言語モデルで、DeepSeek R1 の出力を使用してトレーニングされています。 |
テキスト生成 | 2025-02-03 |
| Qwen シリーズのモデルは、能力のバランスが取れており、Qwen-Max と Qwen-Turbo の中間の推論パフォーマンスと速度を提供し、中程度の複雑なタスクに適しています。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成、推論 | 2025-01-27 |
| 671B パラメーター (37B をアクティブ化) を持つ自己開発の Mixture-of-Experts (MoE) モデルで、14.8T トークンで事前学習されています。長文処理、コーディング、数学、百科事典的知識、中国語タスクで優れた能力を発揮します。 |
動画生成 | 2025-01-20 |
| 画像を複雑な動き、物理的なリアリズム、映画的な品質、およびより高いビデオ忠実度のための改善された命令遵守を持つ動的なビデオに変換する Image-to-Video Generation-Plus モデルです。 |
画像生成 | 2025-01-20 |
| リアルなポートレートと創造的なデザインに特化した強化された Text-to-Image モデルで、美学、リアリズム、芸術性がアップグレードされ、最大 2MP の解像度とスマートプロンプトリライトをサポートします。 |
動画生成 | 2025-01-16 |
| Emoji は、顔画像とプリセットの動的テンプレートを使用して顔アニメーションビデオを作成する顔アニメーションビデオ生成モデルです。 |
動画生成 | 2025-01-16 |
| Emoji-Detect は、絵文字生成を支援する画像検出モデルで、キャラクター画像がビデオ生成要件を満たしているかどうかを検出するために使用されます。 |
テキスト生成 | 2025-01-15 |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
画像生成 | 2025-01-15 |
| AI 試着 OutfitAnyone のサポートモジュールとして機能する画像セグメンテーションモデルで、試着画像の事前/事後処理のためにモデル画像と衣服画像をセグメント化できます。 |
動画生成 | 2025-01-09 |
| Wanxiang 2.1 - Text-to-Video - Turbo。複雑な動き、物理シミュレーション、芸術的なスタイル、映画品質をサポートする高速ビデオ生成。命令追従能力が向上しました。 |
動画生成 | 2025-01-09 |
| Wanxiang 2.1 - Text-to-Video - Plus。テキストプロンプトから高品質なビデオを生成します。複雑な動き、リアルな物理シミュレーション、多様な芸術的スタイル、映画的なビジュアルをサポートします。命令追従パフォーマンスが向上しました。 |
画像生成 | 2025-01-09 |
| Wanxiang 2.1 - Text-to-Image - Turbo。美学、リアリズム、芸術性が向上した高速生成速度。強力なセマンティック理解、スタイル多様性、2MP 解像度サポートを維持します。スマートプロンプトリライト機能が含まれています。 |
画像生成 | 2025-01-09 |
| Wanxiang 2.1 - Text-to-Image - Plus。美学、リアリズム、芸術性が向上したアップグレードされた画像生成。セマンティック理解、スタイル汎化が改善され、最大 2MP の解像度をサポートします。スマートプロンプトリライト機能とより豊かな視覚的ディテールが特徴です。 |
リアルタイム音声認識 | 2024-12-31 |
| ライブストリーミング/会議向けの多言語切り替えをサポートする推奨 Paraformer リアルタイム音声認識モデルです。8kHz のカスタマーサービスシナリオで language_hints パラメーターによる言語選択を可能にし、精度を向上させます。サポート言語:北京語 (方言を含む)、英語、日本語、韓国語。 |
テキスト生成 | 2024-12-26 |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
マルチモーダル埋め込み | 2024-12-23 |
| Tongyi Lab が事前学習済みマルチモーダル基盤モデルに基づいて開発したマルチモーダルベクトルモデルです。テキスト、画像、またはビデオ入力から高次元の連続ベクトルを生成し、検索、分類、コンテンツモデレーションなどの下流タスクに使用します。 |
音声認識 | 2024-12-19 |
| 最新の Paraformer 北京語音声認識モデルで、アーキテクチャが強化され、認識精度が向上し、8kHz の電話音声サポート (中国語ホットワードのみ) が追加されました。 |
テキスト生成 | 2024-12-12 |
| 対話システム向けの意図検出およびスロット充填モデルで、単一の出力で API ベースの意図とスロットパラメーターの共同予測を可能にし、複数の API コマンドと充填されたスロットを含む標準化された JSON 結果を返します。 |
動画生成 | 2024-12-10 |
| 入力されたキャラクタービデオと音声に基づいて、口の動きを音声コンテンツに合わせて口パク動画を合成するキャラクタービデオ生成モデルです。 |
動画生成 | 2024-12-10 |
| AnimateAnyone を支援するモーションテンプレート生成モデルで、ビデオから人間の動きを抽出し、テンプレートを作成できます。 |
動画生成 | 2024-12-10 |
| 人物のポートレートとモーションテンプレートに基づいて全身モーションビデオを作成するビデオ生成モデルです。 |
動画生成 | 2024-12-10 |
| AnimateAnyone を支援する画像検出モデルで、画像内の人物がビデオ生成要件を満たしているかどうかを検証するために使用されます。 |
視覚理解 | 2024-11-14 |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
テキスト生成 | 2024-11-12 |
| Qwen-Coder-Plus は、プログラミングとコード生成に特化した言語モデルで、優れたパフォーマンスと卓越した結果を提供します。 |
動画生成 | 2024-11-07 |
| LivePortrait-detect は、画像内の人物がビデオ生成要件を満たしているかどうかを評価するための補助画像検出モデルです。 |
動画生成 | 2024-11-07 |
| LivePortrait は、静止画像から軽量な動的ポートレートビデオを作成するビデオ生成モデルです。 |
動画生成 | 2024-11-07 |
| EMO は、キャラクター画像に基づいて高品質な動的ポートレートビデオを生成するビデオ生成モデルです。 |
動画生成 | 2024-11-07 |
| EMO-Detect は、EMO を支援する画像検出モデルで、キャラクター画像がビデオ生成要件を満たしているかどうかを検出するために使用されます。 |
テキスト生成 | 2024-10-15 |
| Qwen-Max は、数百億のパラメーター規模と、中国語や英語などの複数の入力言語をサポートします。Qwen-Max はローリング方式で更新されます。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成 | 2024-09-19 |
| Qwen-Math-Turbo は、高い推論速度と低コストを特徴とする、数学の問題解決に特化した言語モデルです。 |
テキスト生成 | 2024-09-19 |
| Qwen-Math-Plus は、方程式、計算、証明など、中国語と英語の数学タスクに優れた強力な数学の問題解決モデルです。 |
テキスト生成 | 2024-09-19 |
| Qwen-Coder-Turbo は、高い推論速度と低コストを特徴とする、プログラミングとコード生成に特化した言語モデルです。 |
音声合成 | 2024-09-13 |
| Cosyvoice-v3 と連携して使用される大規模モデル音声複製サービスです。高度な大規模モデル技術を特徴抽出に利用し、トレーニングプロセスなしで音声を複製できます。非常に短い音声クリップだけで、非常に類似した自然な響きのカスタム音声を迅速に生成できます。 |
動画生成 | 2024-09-13 |
| 入力ビデオフレームに芸術的なスタイル (例:日本の漫画、3D カートゥーン) を適用しながら元の外観を保持し、多様な視覚効果を持つスタイル化されたビデオを生成するビデオスタイル再描画モデルです。 |
テキスト生成 | 2024-09-13 |
| Qwen-Math-Plus は、方程式、計算、証明など、中国語と英語の数学タスクに優れた強力な数学の問題解決モデルです。 |
音声合成 | 2024-09-13 |
| 高度な大規模モデル技術を活用してトレーニングなしで特徴抽出を行う音声クローニングモデルです。短い音声サンプルから非常に類似した自然な響きのカスタム音声を生成します。 |
音声認識 | 2024-09-06 |
| language_hints パラメーターによる多言語認識をサポートする推奨 Paraformer 音声認識モデルです。サポート言語:北京語 (方言を含む)、英語、日本語、韓国語のすべてのサンプリングレートとホットワードをサポートします。 |
リアルタイム音声認識 | 2024-09-06 |
| language_hints パラメーターによる多言語切り替えをサポートする推奨 Paraformer リアルタイム音声認識モデルです。サポート言語:北京語 (方言を含む)、英語、日本語、韓国語のすべてのサンプリングレートとホットワードをサポートします。 |
画像生成 | 2024-08-19 |
| 人物インスタンスセグメンテーションは、検出およびセグメンテーション技術を使用して画像内のオブジェクトを識別し、正確なオブジェクト境界の描写のためにピクセルレベルのマスクを生成します。 |
画像生成 | 2024-08-19 |
| コンピュータビジョンと AIGC インペインティング技術を使用して、背景を保持しながら指定された要素 (人物、オブジェクト、テキスト、ウォーターマーク) を削除する画像消去および補完ツールです。 |
香港 (中国)
モデルタイプ | 日付 | サービス範囲 | モデル ID | 説明 |
|---|---|---|---|---|
テキスト生成、推論、視覚理解 | 2026-09-02 | インターナショナル |
| Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) is an upgraded snapshot of qwen3.8-max. Coding capability breaks new ground, handling more complex engineering-scale projects and long-horizon autonomous development. Collaborative agent performance is significantly enhanced, with greater composure in multi-tool orchestration and end-to-end task delivery. Native vision understanding is refined across chart reasoning, document parsing, and multimodal perception — sharper and more reliable. Retains the 1M context window, thinking mode, and full tool ecosystem, evolving at a higher level of intelligence. |
テキスト生成、深い思考、視覚理解 | 2026-08-26 | インターナショナル |
| Qwen3.8-Flash は千問3.8シリーズの軽量フラッグシップモデルで、100万トークンのコンテキストウィンドウ、最大128kの出力長、256kの思考バジェットをサポートします。深い推論、Function Calling、構造化出力、組み込みツール、ネイティブ視覚理解に対応し、性能とコストの最適なバランスを実現します。日常的なテキスト生成からエージェントシナリオまで幅広いタスクに適しています。 |
動画生成 | 2026-08-20 | グローバル |
| Wan3.0-Video-Prime は、Wan3.0 動画生成モデルの高速バージョンであり、その機能は Wan3.0-Video 標準バージョンに準拠しています。4 モーダル完全参照入力をサポートし、最大 30 秒の動画を生成でき、エンドツーエンドの速度が大幅に向上した没入感のある視聴覚体験を提供します。 |
テキスト生成、推論、視覚理解 | 2026-08-19 | グローバル |
| Kimi K3 は、2.8 兆のパラメーターを持つ Kimi の最も強力なフラッグシップモデルです。KDA ハイブリッド線形アテンション (Kimi Delta Attention) および Attention Residuals 技術に基づいて構築されており、ネイティブで視覚理解をサポートし、100 万トークンのコンテキストウィンドウを備えています。これは、ロングコンテキストプログラミング、ナレッジワーク、および高度な推論のために設計された、世界初のオープンソース 3 兆パラメーターモデルです。 |
テキスト生成、推論 | 2026-08-14 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ Mixture-of-Experts (MoE) 大規模言語モデルです。ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。広範な高品質データでトレーニングされたこのモデルは、数学的・論理的推論、複雑な推論、プロフェッショナルなコード生成、詳細な長文ドキュメント分析において強力なパフォーマンスを発揮し、先端科学研究、複雑な企業ワークフロー、高度なエージェントアプリケーションなどの要求の厳しいシナリオに適しています。 |
画像生成 | 2026-08-06 | グローバル |
| 豊富なコンテンツ:最大 4.5k トークンの入力と、画像内画像による高密度な情報レイアウトをサポートし、新聞、絵コンテ、メニュー、試験問題などの複雑なレイアウトを一度に生成できます。 本物のディテール:10px の小さなテキストの正確なレンダリングをサポートし、微細な表情、毛穴、髪の毛一本一本などの細かいディテールを鮮やかに再現し、実際の写真の品質に近づきます。 深い知識:12 言語と 20 以上のフォントのネイティブレンダリング、Web ページ、ゲーム、ライブストリームなどの主流インターフェイスのリアルなシミュレーションをサポートし、外部知識を完全に組み込みます。 Qwen-Image-3.0-Pro は「見栄えの良さ」だけでなく、「実用性」も追求しており、画像生成を真に展開可能な生産性ツールにしています。 |
画像生成 | 2026-08-04 | グローバル |
| 明確な命令理解:最大 4.5k トークンの入力をサポートし、複雑な画像テキスト命令を一度に生成します。安定したテキストレンダリング:10px の小さなテキスト、12 言語、20 以上のフォントが鮮明に読み取れ、インフォグラフィックやインターフェイスにすぐに使用できます。便利なバッチ出力:ポスター、Web ページ、インターフェイスなどの日常的なタスクを低コストで一括生成でき、継続的な作成に最適です。Qwen-Image-3.0 Standard は、生成品質だけでなく、日常の創造的な利便性も追求し、画像生成を持続可能なコンテンツ生産性ツールにします。 |
テキスト生成、推論、視覚理解 | 2026-08-02 | グローバル |
| 2.4 兆パラメーターの MoE フラッグシップで、コーディングとオフィス能力が包括的に飛躍し、数日間にわたって自律的にコーディングして完全なプロジェクトを提供できます。法律、金融、デザインなどの数百の専門的なタスクを処理し、1 回の対話でエンドツーエンドのプロダクションレベルの結果を提供します。ネイティブの視覚理解は、計画、実行、検証のパイプライン全体を通じて実行され、超長文ドキュメントと長尺動画の深層セマンティック解析をサポートします。長期タスクにおいて自律的計画とクローズドループ反復を実行し、継続的に進化します。 |
テキスト生成、推論 | 2026-08-01 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-07-21 | グローバル |
| Qwen3.7 ネイティブ視覚言語シリーズ Flash モデルは、3.6-Flash と比較してマルチモーダル理解とエージェント実行能力を包括的に強化しています。主な改善点には、基礎的なマルチモーダル能力の強化、オブジェクト認識の向上、実世界認識と空間的知性の改善が含まれます。Search Agent や CI Agent などのマルチモーダルエージェントシナリオは大幅にアップグレードされ、より安定したエンドツーエンドのタスク実行が可能になりました。マルチモーダルコーディング能力が最適化され、よりスムーズな Vibe コーディング体験を提供します。 |
テキスト生成 | 2026-07-02 | グローバル |
| Qwen シリーズのロールプレイングモデルです。これは動的に更新されるバージョンであり、モデルの更新については事前に通知が提供されます。擬人化ロールプレイングに適しており、事前定義されたキャラクターの指示に従う、会話を進める、積極的な傾聴と共感を示す能力が最適化されています。さらに、パーソナライズされたキャラクターの深い復元をサポートします。 |
テキスト生成、推論 | 2026-06-16 | グローバル |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
テキスト生成、推論、視覚理解 | 2026-06-15 | グローバル |
| kimi-k2.7-code は、Kimi のこれまでで最もインテリジェントなコーディングモデルです。ロングコンテキストでより確実に命令に従い、より高い成功率でプログラミングタスクを完了します。テキスト、画像、動画の入力をサポートし、思考モード、会話、エージェントタスクにも対応しています。 |
テキスト生成、推論、視覚理解 | 2026-06-09 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、5 月 20 日のスナップショットと比較して視覚モーダル理解が追加され、実世界のシーンを認識し、マルチモーダル対話型ハイブリッドエージェント機能をサポートします。このバージョンは 2026 年 6 月 8 日に取得されたスナップショットに基づいています。 |
テキスト生成、推論、視覚理解 | 2026-06-01 | グローバル |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
テキスト生成、推論 | 2026-05-20 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成、推論、視覚理解 | 2026-04-01 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Plus シリーズモデルは、現在の最先端モデルに匹敵する卓越したパフォーマンスを示し、3.5 シリーズと比較して全体的な結果が大幅に向上しています。このモデルは、エージェントコーディング、フロントエンドプログラミング、Vibe コーディングなどのコード関連能力、およびマルチモーダル一般オブジェクト認識、OCR、オブジェクトローカライゼーションにおいて著しく強化されています。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | 香港 |
| Qwen3.5 ネイティブ視覚言語 Flash モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルタスクの両方でパフォーマンスが飛躍的に向上し、推論速度と全体的なパフォーマンスのバランスを取りながら高速な応答時間を提供します。 |
テキスト生成、推論 | 2026-01-23 | 香港 |
| 2025 年 9 月 23 日時点のスナップショットと比較して、このリリースの Qwen-3 シリーズ Max モデルは、思考モードと非思考モードの効果的な統合を実現し、モデルの全体的なパフォーマンスが包括的かつ大幅に向上しています。思考モードでは、モデルは Web 検索、Web 情報抽出、コードインタープリターツールを同時にサポートし、遅く慎重な推論を行いながら外部ツールを活用することで、より複雑で困難な問題をより高い精度で解決できます。このバージョンは 2026 年 1 月 23 日に取得されたスナップショットに基づいています。 |
推論、視覚理解 | 2025-12-18 | 香港 |
| Qwen3 シリーズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。9 月 23 日にリリースされたスナップショットと比較して、このバージョンは推論および分析タスク、スタイル制御において優れたパフォーマンスを提供し、同時により低いレイテンシと高速な応答速度を提供します。このバージョンは 2025 年 12 月 19 日に取得されたスナップショットに基づいています。 |
— | 2025-12-01 | 香港 |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
テキスト生成、推論 | 2025-09-24 | 香港 |
| Qwen 3 シリーズ Max モデルは、プレビューバージョンと比較して、エージェントプログラミングとツール呼び出しにおいて専門的なアップグレードが行われています。今回正式にリリースされたモデルは、その分野で最先端 (SOTA) のパフォーマンスを達成しており、より複雑なシナリオで動作するエージェントの要求により適しています。 |
視覚理解 | 2025-09-23 | 香港 |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。 |
テキスト生成、推論 | 2025-09-16 | 香港 |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト埋め込み | 2025-08-25 | 香港 |
| 一般テキストベクトル V4 バージョンは、Tongyi Lab が Qwen3 に基づいて開発した多言語テキストベクトルモデルです。V3 バージョンと比較して、テキスト検索、クラスタリング、分類タスクのパフォーマンスを大幅に向上させます。MTEB 多言語、中英、コード検索などの評価タスクで 15% から 40% の改善を達成しています。さらに、64 から 2048 の範囲でユーザー定義のベクトル次元をサポートします。 |
ドイツ (フランクフルト)
モデルタイプ | 日付 | サービス範囲 | モデル ID | 説明 |
|---|---|---|---|---|
テキスト生成、推論、視覚理解 | 2026-09-02 | インターナショナル |
| Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) is an upgraded snapshot of qwen3.8-max. Coding capability breaks new ground, handling more complex engineering-scale projects and long-horizon autonomous development. Collaborative agent performance is significantly enhanced, with greater composure in multi-tool orchestration and end-to-end task delivery. Native vision understanding is refined across chart reasoning, document parsing, and multimodal perception — sharper and more reliable. Retains the 1M context window, thinking mode, and full tool ecosystem, evolving at a higher level of intelligence. |
テキスト生成、深い思考、視覚理解 | 2026-08-26 | インターナショナル |
| Qwen3.8-Flash は千問3.8シリーズの軽量フラッグシップモデルで、100万トークンのコンテキストウィンドウ、最大128kの出力長、256kの思考バジェットをサポートします。深い推論、Function Calling、構造化出力、組み込みツール、ネイティブ視覚理解に対応し、性能とコストの最適なバランスを実現します。日常的なテキスト生成からエージェントシナリオまで幅広いタスクに適しています。 |
動画生成 | 2026-08-20 | グローバル |
| Wan3.0-Video-Prime は、Wan3.0 動画生成モデルの高速バージョンであり、その機能は Wan3.0-Video 標準バージョンに準拠しています。4 モーダル完全参照入力をサポートし、最大 30 秒の動画を生成でき、エンドツーエンドの速度が大幅に向上した没入感のある視聴覚体験を提供します。 |
テキスト生成、推論、視覚理解 | 2026-08-19 | グローバル |
| Kimi K3 は、2.8 兆のパラメーターを持つ Kimi の最も強力なフラッグシップモデルです。KDA ハイブリッド線形アテンション (Kimi Delta Attention) および Attention Residuals 技術に基づいて構築されており、ネイティブで視覚理解をサポートし、100 万トークンのコンテキストウィンドウを備えています。これは、ロングコンテキストプログラミング、ナレッジワーク、および高度な推論のために設計された、世界初のオープンソース 3 兆パラメーターモデルです。 |
テキスト生成、推論 | 2026-08-14 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ Mixture-of-Experts (MoE) 大規模言語モデルです。ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。広範な高品質データでトレーニングされたこのモデルは、数学的・論理的推論、複雑な推論、プロフェッショナルなコード生成、詳細な長文ドキュメント分析において強力なパフォーマンスを発揮し、先端科学研究、複雑な企業ワークフロー、高度なエージェントアプリケーションなどの要求の厳しいシナリオに適しています。 |
動画生成 | 2026-08-06 | グローバル |
| Wan3.0 は、参照、編集、複製、駆動などの複数の創造的機能を統一的にサポートするオールインワン動画生成モデルです。4 モーダル完全参照入力、最大 30 秒の動画生成をサポートし、ファイル、Web ページ、複雑な画像を解析できます。プロダクションレベルのキャラクター一貫性とリアルな音声と映像により、没入感のある視聴覚的インパクトを提供します。 |
画像生成 | 2026-08-06 | グローバル |
| 豊富なコンテンツ:最大 4.5k トークンの入力と、画像内画像による高密度な情報レイアウトをサポートし、新聞、絵コンテ、メニュー、試験問題などの複雑なレイアウトを一度に生成できます。 本物のディテール:10px の小さなテキストの正確なレンダリングをサポートし、微細な表情、毛穴、髪の毛一本一本などの細かいディテールを鮮やかに再現し、実際の写真の品質に近づきます。 深い知識:12 言語と 20 以上のフォントのネイティブレンダリング、Web ページ、ゲーム、ライブストリームなどの主流インターフェイスのリアルなシミュレーションをサポートし、外部知識を完全に組み込みます。 Qwen-Image-3.0-Pro は「見栄えの良さ」だけでなく、「実用性」も追求しており、画像生成を真に展開可能な生産性ツールにしています。 |
画像生成 | 2026-08-04 | グローバル |
| 明確な命令理解:最大 4.5k トークンの入力をサポートし、複雑な画像テキスト命令を一度に生成します。安定したテキストレンダリング:10px の小さなテキスト、12 言語、20 以上のフォントが鮮明に読み取れ、インフォグラフィックやインターフェイスにすぐに使用できます。便利なバッチ出力:ポスター、Web ページ、インターフェイスなどの日常的なタスクを低コストで一括生成でき、継続的な作成に最適です。Qwen-Image-3.0 Standard は、生成品質だけでなく、日常の創造的な利便性も追求し、画像生成を持続可能なコンテンツ生産性ツールにします。 |
テキスト生成、推論、視覚理解 | 2026-08-02 | グローバル |
| 2.4 兆パラメーターの MoE フラッグシップで、コーディングとオフィス能力が包括的に飛躍し、数日間にわたって自律的にコーディングして完全なプロジェクトを提供できます。法律、金融、デザインなどの数百の専門的なタスクを処理し、1 回の対話でエンドツーエンドのプロダクションレベルの結果を提供します。ネイティブの視覚理解は、計画、実行、検証のパイプライン全体を通じて実行され、超長文ドキュメントと長尺動画の深層セマンティック解析をサポートします。長期タスクにおいて自律的計画とクローズドループ反復を実行し、継続的に進化します。 |
テキスト生成、推論 | 2026-08-01 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-07-21 | グローバル |
| Qwen3.7 ネイティブ視覚言語シリーズ Flash モデルは、3.6-Flash と比較してマルチモーダル理解とエージェント実行能力を包括的に強化しています。主な改善点には、基礎的なマルチモーダル能力の強化、オブジェクト認識の向上、実世界認識と空間的知性の改善が含まれます。Search Agent や CI Agent などのマルチモーダルエージェントシナリオは大幅にアップグレードされ、より安定したエンドツーエンドのタスク実行が可能になりました。マルチモーダルコーディング能力が最適化され、よりスムーズな Vibe コーディング体験を提供します。 |
テキスト生成 | 2026-07-02 | グローバル |
| Qwen シリーズのロールプレイングモデルです。これは動的に更新されるバージョンであり、モデルの更新については事前に通知が提供されます。擬人化ロールプレイングに適しており、事前定義されたキャラクターの指示に従う、会話を進める、積極的な傾聴と共感を示す能力が最適化されています。さらに、パーソナライズされたキャラクターの深い復元をサポートします。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-T2V は、セマンティック理解、映画的なショットコントロール、ダイナミックなモーションレンダリングが向上した Text-to-Video 生成をサポートします。創造的な意図をより正確に捉え、より滑らかな動き、豊かなディテール、強力な視覚的一貫性、そしてより自然なキャラクターのアクション、シーンの雰囲気、物理的なダイナミクスを持つ高品質な動画を生成します。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-R2V は、被写体、シーンスタイル、視覚的一貫性の安定性が大幅に向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像をサポートし、創造的な意図をより正確に理解して保持し、キャラクター、シーン、スタイル、映画的な動き全体でより強力な制御性と表現力を提供します。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-I2V は、視覚品質、動的パフォーマンス、クリップ間の一貫性が向上した Image-to-Video 生成をサポートします。入力画像をより正確に理解し、創造的な意図を保持することで、肌の質感のリアリズム、クリップ間のキャラクター ID の一貫性、動きの滑らかさ、テキストレンダリングの安定性、視聴覚同期が大幅に改善され、より高いリアリズム、豊かなディテール、強力な全体的一貫性を持つ高品質な動画を生成します。 |
テキスト生成、推論 | 2026-06-16 | グローバル |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
テキスト生成、推論、視覚理解 | 2026-06-15 | グローバル |
| kimi-k2.7-code は、Kimi のこれまでで最もインテリジェントなコーディングモデルです。ロングコンテキストでより確実に命令に従い、より高い成功率でプログラミングタスクを完了します。テキスト、画像、動画の入力をサポートし、思考モード、会話、エージェントタスクにも対応しています。 |
テキスト生成、推論、視覚理解 | 2026-06-09 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、5 月 20 日のスナップショットと比較して視覚モーダル理解が追加され、実世界のシーンを認識し、マルチモーダル対話型ハイブリッドエージェント機能をサポートします。このバージョンは 2026 年 6 月 8 日に取得されたスナップショットに基づいています。 |
テキスト生成、推論、視覚理解 | 2026-06-01 | グローバル |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
テキスト生成、推論 | 2026-05-20 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
テキスト生成、推論、視覚理解 | 2026-04-29 | グローバル |
| Kimi-k2.5 は、Moonshot AI の最も多機能なモデルで、ネイティブのマルチモーダルアーキテクチャを備え、視覚/テキスト入力、思考/非思考モード、および対話とエージェントタスクの両方をサポートします。 |
動画生成 | 2026-04-26 | グローバル |
| HappyHorse-1.0-V2V は、自然言語の命令による高度なビデオ編集をサポートします。最大 5 枚の参照画像を使用してビデオ要素の局所的または全体的な編集を可能にし、元の動きのダイナミクスを正確に保持して優れた表現力を実現します。 |
動画生成 | 2026-04-26 | グローバル |
| HappyHorse-1.0-R2V は、被写体とシーンの参照における安定性が向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像を処理でき、創造的な意図を正確に保持して優れたパフォーマンスを提供します。 |
テキスト生成、推論 | 2026-04-24 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ MoE 大規模モデルで、ネイティブで最大 100 万トークンのコンテキスト長をサポートします。膨大な高品質データコーパスでトレーニングされており、高度な数学的推論、複雑な論理的推論、専門的なコーディング、長文テキストの詳細な分析に優れており、最先端の研究、洗練されたオフィスワークフロー、高度な AI エージェントなどの要求の厳しいアプリケーションに適しています。 |
テキスト生成、推論 | 2026-04-24 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
動画生成 | 2026-04-22 | グローバル |
| HappyHorse-1.0-T2V は、非常にリアルな動的レンダリングを特徴とするテキスト動画生成をサポートします。テキストのセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
動画生成 | 2026-04-22 | グローバル |
| HappyHorse-1.0-I2V は、非常にリアルな動的レンダリングを特徴とする画像動画生成を可能にします。テキストと画像の両方のセマンティクスを正確に理解し、流動的で自然、かつディテールに富んだ高品質な動画を生成します。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | グローバル |
| Qwen3.6 35B-A3B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートフレームワークを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3.5-35B-A3B と比較して、このモデルはエージェントコーディング能力、数学的およびコード推論能力、空間的知性、ならびにオブジェクトローカライゼーションおよびオブジェクト検出パフォーマンスが大幅に向上しています。 |
テキスト生成、推論 | 2026-04-14 | グローバル |
| GLM-5.1 は、Zhipu AI によって開発されたモデルで、長期タスク向けに特別に設計されています。7,440 億のパラメーターを持ち、20 万トークンの超長コンテキストをサポートし、1 回の応答で最大 12 万 8,000 トークンを生成できます。GLM-5.1 は、論理的推論、長文理解、コード生成に優れており、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れた結果を出し、インテリジェントなヒューマンコンピュータインタラクション、エンタープライズソリューション、開発者支援などのアプリケーションに適しています。 |
テキスト生成、推論、視覚理解 | 2026-04-01 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Plus シリーズモデルは、現在の最先端モデルに匹敵する卓越したパフォーマンスを示し、3.5 シリーズと比較して全体的な結果が大幅に向上しています。このモデルは、エージェントコーディング、フロントエンドプログラミング、Vibe コーディングなどのコード関連能力、およびマルチモーダル一般オブジェクト認識、OCR、オブジェクトローカライゼーションにおいて著しく強化されています。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | EU |
| Qwen3.5 ネイティブ視覚言語 Flash モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルタスクの両方でパフォーマンスが飛躍的に向上し、推論速度と全体的なパフォーマンスのバランスを取りながら高速な応答時間を提供します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 ネイティブ視覚言語 Flash モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルタスクの両方でパフォーマンスが飛躍的に向上し、推論速度と全体的なパフォーマンスのバランスを取りながら高速な応答時間を提供します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 シリーズ 35B-A3B は、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャで設計されたネイティブ視覚言語モデルで、より高い推論効率を実現しています。その全体的なパフォーマンスは Qwen3.5-27B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 27B ネイティブ視覚言語密モデルは、線形アテンションメカニズムを組み込んでおり、推論速度とパフォーマンスのバランスを取りながら高速な応答時間を提供します。その全体的な能力は Qwen3.5-122B-A10B に匹敵します。 |
テキスト生成、推論、視覚理解 | 2026-02-23 | グローバル |
| Qwen3.5 122B-A10B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。全体的なパフォーマンスの観点から、このモデルは Qwen3.5-397B-A17B に次ぐものです。そのテキスト能力は Qwen3-235B-2507 を大幅に上回り、視覚能力は Qwen3-VL-235B を超えています。 |
テキスト生成 | 2026-02-20 | EU |
| Qwen3 シリーズの新世代コード生成モデルは、Qwen3-Coder-Plus に近いパフォーマンスを提供しながら、さらに優れた機能を提供します。このモデルは、リポジトリレベルの理解に重点を置いて最適化されており、マルチターンのツールインタラクションをサポートし、エージェントコーディングツールとの互換性を強化しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 | グローバル |
| Qwen3.5 ネイティブ視覚言語シリーズ Plus モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。さまざまなタスク評価において、3.5 シリーズは一貫して最先端の主要モデルと同等のパフォーマンスを示しています。3 シリーズと比較して、これらのモデルは純粋なテキストとマルチモーダルの両方の能力で飛躍的な進歩を示しています。 |
テキスト生成、推論、視覚理解 | 2026-02-15 | グローバル |
| Qwen3.5 シリーズ 397B-A17B ネイティブ視覚言語モデルは、線形アテンションメカニズムとスパース混合エキスパートモデルを統合したハイブリッドアーキテクチャに基づいて構築されており、より高い推論効率を実現しています。言語理解、論理的推論、コード生成、エージェントベースのタスク、画像理解、動画理解、グラフィカルユーザーインターフェイス (GUI) インタラクションなど、幅広いタスクで最先端のモデルに匹敵する最先端のパフォーマンスを提供します。堅牢なコード生成とエージェント能力により、このモデルは多様なエージェントで強力な汎化能力を示します。 |
テキスト生成、推論 | 2026-01-23 | EU |
| 2025 年 9 月 23 日時点のスナップショットと比較して、このリリースの Qwen-3 シリーズ Max モデルは、思考モードと非思考モードの効果的な統合を実現し、モデルの全体的なパフォーマンスが包括的かつ大幅に向上しています。思考モードでは、モデルは Web 検索、Web 情報抽出、コードインタープリターツールを同時にサポートし、遅く慎重な推論を行いながら外部ツールを活用することで、より複雑で困難な問題をより高い精度で解決できます。このバージョンは 2026 年 1 月 23 日に取得されたスナップショットに基づいています。 |
視覚理解 | 2026-01-22 | EU |
| Qwen3 シリーズの small サイズの視覚理解モデルは、思考モードと非思考モードを効果的に統合しています。2025 年 10 月 15 日に取得されたスナップショットと比較して、モデルの全体的なパフォーマンスは大幅に向上しています。一般的な視覚認識と推論の能力が向上し、セキュリティ、店舗内検査、機器モニタリング、写真ベースの問題解決などのさまざまなビジネスシナリオでの認識精度が著しく向上しています。このバージョンは 2026 年 1 月 22 日時点のスナップショットです。 |
動画生成 | 2025-12-16 | グローバル |
| Wan2.6 参照動画生成は、指定された人物または任意のオブジェクトをリファレンスとして使用することをサポートし、外観と声の一貫性を正確に維持し、共同パフォーマンスのための複数キャラクター参照を可能にします。 |
画像生成 | 2025-12-15 | グローバル |
| Wan2.6 Text-to-Image、アップグレードされた視覚品質、美学、命令追従により、正確なスタイル制御、リアルなポートレート、長文理解、広範な歴史的/文化的 IP のカバレッジを提供し、高品質で表現力豊かな視覚生成を可能にします。 |
画像生成 | 2025-12-15 | グローバル |
| Wan2.6 Image は、テキストと画像の共同推論、複数画像の創造的融合、商用レベルの一貫性、美的スタイル変換、フレーミングとライティングの正確な制御をサポートするオールラウンドな画像生成モデルで、画像生成における一貫性、制御性、表現力を大幅に向上させます。 |
動画生成 | 2025-12-03 | グローバル |
| Wan2.6 テキスト動画生成、インテリジェントなショットスケジューリングはマルチショットストーリーテリングをサポートし、一貫した被写体、シーン、雰囲気を持つマルチショットの物語動画を生成し、最大持続時間は 15 秒です。より良い命令追従と改善された視覚的忠実度を提供します。 |
動画生成 | 2025-12-03 | グローバル |
| Wan2.6 画像動画生成、インテリジェントなショットスケジューリングによりマルチカメラストーリーテリングが可能になり、より高品質な音声生成を提供し、より自然でリアルな声の音色で安定した複数話者対話をサポートし、最大 15 秒のクリップの生成をサポートします。 |
— | 2025-12-01 | EU |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
— | 2025-12-01 | グローバル |
| このバージョンは 2025 年 12 月 1 日時点のスナップショットであり、7 月 28 日のスナップショットと比較して推論能力が向上しています。エージェント能力とマルチターンのツール呼び出し能力がさらに強化され、主観的な創造的タスクのパフォーマンスが大幅に向上しました。最大 100 万トークンのコンテキスト長をサポートし、コンテキスト長に応じた段階的価格設定が適用されます。 |
視覚理解 | 2025-11-21 | グローバル |
| このモデルは 2025 年 11 月 20 日のスナップショットバージョンであり、最新の Qwen-VL3 アーキテクチャに基づいて包括的にアップグレードされています。ドキュメント解析とテキストローカライゼーション能力が大幅に向上し、エンドツーエンドのレイテンシと幻覚が大幅に削減されています。 |
視覚理解 | 2025-11-20 | グローバル |
| Qwen-VL_OCR は、Qwen-VL に基づいてトレーニングされた OCR モデルです。統一されたモデルアプローチを通じて、さまざまな画像テキスト認識、解析、処理タスクを集約し、強力な画像テキスト認識機能を提供します。 |
テキスト生成 | 2025-11-19 | グローバル |
| Qwen-MT-Lite は、多言語翻訳に特化した Qwen モデルシリーズの大規模言語モデルです。32 の言語で高品質かつ迅速な翻訳サービスをコスト効率の高い価格で提供します。用語介入、フォーマット保持、ドメイン固有の翻訳などの機能を提供し、さまざまなアプリケーションの多様なニーズに対応し、効率とパフォーマンスの両方を保証します。 |
テキスト生成 | 2025-11-11 | グローバル |
| Qwen シリーズの大規模言語モデルである Qwen-MT-Flash は、Qwen 3 アーキテクチャで完全にアップグレードされ、パフォーマンスと翻訳品質が大幅に向上しました。92 の言語で迅速かつコスト効率の高い翻訳を提供し、用語介入、フォーマット保持、ドメイン固有の適応などの高度な機能をサポートします。速度、品質、コストの強力なバランスを必要とするアプリケーションに最適な選択肢です。 |
推論、視覚理解 | 2025-10-21 | グローバル |
| Qwen3-VL シリーズで最大の密モデルであり、その推論バージョンは Qwen3-VL-235B-Thinking に次ぐマルチモーダル推論能力を誇ります。STEM と数学の問題解決、一般的な画像および動画理解に優れ、マルチモーダルエージェント能力で最先端のパフォーマンスを達成しており、複雑なマルチモーダル推論タスクに最適です。 |
視覚理解 | 2025-10-21 | グローバル |
| Qwen3-VL シリーズで最大の密モデルであり、非推論バージョンでは、Qwen3-VL-235B-Instruct に次ぐ全体的なパフォーマンスを提供します。ドキュメント認識と理解に優れ、強力な空間認識とオブジェクト識別能力を示し、2D 視覚検出と空間的推論で最先端のパフォーマンスを達成します。幅広い汎用シナリオでの複雑な知覚タスクに適しています。 |
推論、視覚理解 | 2025-10-15 | EU |
| Qwen3 シリーズの small スケールの視覚理解モデルは、思考モードと非思考モードを効果的に統合し、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供しながら、高速な応答速度を維持します。拡張ビデオやドキュメントなどの超長コンテキスト、さまざまなドメインでの空間認識とオブジェクト認識をサポートする、画像/動画理解の包括的なアップグレードを特徴としています。2D/3D 視覚ローカライゼーション機能を備えており、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-10-15 | グローバル |
| Qwen3 シリーズの small スケールの視覚理解モデルは、思考モードと非思考モードを効果的に統合し、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供しながら、高速な応答速度を維持します。拡張ビデオやドキュメントなどの超長コンテキスト、さまざまなドメインでの空間認識とオブジェクト認識をサポートする、画像/動画理解の包括的なアップグレードを特徴としています。2D/3D 視覚ローカライゼーション機能を備えており、複雑な実世界のタスクに取り組むのに適しています。 |
推論、視覚理解 | 2025-10-03 | グローバル |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの思考バージョンは、高速な応答速度と強化されたマルチモーダル理解および推論能力、視覚エージェント、および長い動画やドキュメントなどの非常に長いコンテキストのサポートを特徴としています。また、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力も誇り、複雑な実世界のタスクに適しています。 |
視覚理解 | 2025-10-03 | グローバル |
| Qwen3-VL シリーズで 2 番目に大きい MoE モデルの Instruct バージョンは、迅速な応答速度を提供し、長い動画やドキュメントなどの非常に長いコンテキストをサポートします。これには、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力、および 2D/3D 視覚ローカライゼーションが含まれており、複雑な実世界の課題に対応できます。 |
推論、視覚理解 | 2025-09-30 | グローバル |
| Qwen3-VL シリーズの 8B 密モデルの思考バージョンは、GPU メモリの消費が少なく、マルチモーダル理解と推論を実行できます。長い動画やドキュメントなどの非常に長いコンテキスト、2D/3D 視覚ローカライゼーションをサポートし、包括的にアップグレードされた画像/動画理解、空間認識、オブジェクト認識能力を備えています。 |
視覚理解 | 2025-09-30 | グローバル |
| Qwen3-VL シリーズの 8B 密モデルの Instruct バージョンは、必要な GPU メモリが少なく、包括的にアップグレードされた画像/動画理解、長い動画やドキュメントなどの非常に長いコンテキストのサポート、空間認識、オブジェクト認識能力を提供し、複雑な実世界のタスクに取り組むのに適しています。 |
テキスト生成、推論 | 2025-09-24 | EU |
| Qwen 3 シリーズ Max モデルは、プレビューバージョンと比較して、エージェントプログラミングとツール呼び出しにおいて専門的なアップグレードが行われています。今回正式にリリースされたモデルは、その分野で最先端 (SOTA) のパフォーマンスを達成しており、より複雑なシナリオで動作するエージェントの要求により適しています。 |
テキスト生成、推論 | 2025-09-24 | グローバル |
| Qwen 3 シリーズ Max モデルは、プレビューバージョンと比較して、エージェントプログラミングとツール呼び出しにおいて専門的なアップグレードが行われています。今回正式にリリースされたモデルは、その分野で最先端 (SOTA) のパフォーマンスを達成しており、より複雑なシナリオで動作するエージェントの要求により適しています。 |
視覚理解 | 2025-09-23 | EU |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。 |
視覚理解 | 2025-09-23 | グローバル |
| Qwen3 シリーズ VL モデルは、思考モードと非思考モードを効果的に統合し、OS World などの公開ベンチマークデータセットで視覚エージェント能力において世界をリードするパフォーマンスを達成しています。このバージョンは、視覚コーディング、空間知覚、マルチモーダル推論などの分野で包括的なアップグレードを特徴とし、視覚認識能力を大幅に向上させ、超長尺動画の理解をサポートします。 |
推論、視覚理解 | 2025-09-23 | グローバル |
| Qwen3 シリーズ VL モデルは、マルチモーダル推論能力が大幅に強化されており、特に STEM と数学的推論のためにモデルを最適化することに重点を置いています。視覚認識能力は包括的に改善され、OCR 機能は大幅にアップグレードされました。 |
視覚理解 | 2025-09-23 | グローバル |
| Qwen3 シリーズ VL モデルは、視覚コーディングや空間知覚などの分野で包括的にアップグレードされました。その視覚認識能力は大幅に向上し、超長尺動画の理解をサポートし、OCR 機能は大幅に強化されました。 |
テキスト生成 | 2025-09-23 | グローバル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。これは 2025 年 9 月 23 日のスナップショットです。以前のバージョン (7 月 22 日のスナップショット) と比較して、下流のタスクパフォーマンスとツール呼び出しにおける堅牢性が向上し、コードセキュリティも強化されています。 |
テキスト生成、推論 | 2025-09-16 | EU |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成、推論 | 2025-09-16 | グローバル |
| Qwen-Plus は、中国語や英語などの複数の入力言語をサポートする Qwen 超大規模言語モデルの強化版です。以前のバージョンと比較して、中国語と英語の両方のコード生成、論理的推論、多言語能力が大幅に向上しています。応答スタイルは人間の好みに合わせて大幅に調整され、応答の詳細さと明瞭さが著しく向上しています。創造的なライティング、JSON フォーマットへの準拠、ロールプレイング能力において専門的な改善が行われています。 |
テキスト生成、推論 | 2025-09-11 | グローバル |
| Qwen3 ベースのオープンソース思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Thinking-2507) よりも改善された命令追従と合理化された要約応答を提供します。 |
テキスト生成 | 2025-09-11 | グローバル |
| Qwen3 を搭載したオープンソースの非思考モードモデルの新世代です。このバージョンは、以前のイテレーション (Qwen3-235B-A22B-Instruct-2507) よりも優れた中国語テキスト理解、強化された論理的推論、およびテキスト生成タスクにおける能力の向上を示しています。 |
テキスト生成、推論 | 2025-09-11 | グローバル |
| 2025 年 9 月 11 日のスナップショットとして、このリリースは思考モードでの命令追従の強化と合理化された要約応答を特徴としています。非思考モードは、優れた中国語テキスト理解と強化された論理的推論能力を提供します。このモデルは 1M のコンテキスト長をサポートし、段階的価格設定が適用されます。 |
テキスト生成、推論 | 2025-09-05 | グローバル |
| Qwen 3 シリーズの Max モデルのプレビューバージョンで、思考モードと非思考モードの効果的な統合を実現しています。思考モードでは、インテリジェントなエージェントプログラミング、常識的な推論、数学、科学、一般領域にわたる推論などの能力が大幅に向上しています。 |
テキスト生成、推論 | 2025-08-01 | グローバル |
| Qwen3 Flash モデルは、思考モードと非思考モードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令追従とテキスト理解において大幅な向上を示します。1M のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで請求されます。 |
テキスト生成 | 2025-07-31 | グローバル |
| Qwen3 ベースのコード生成モデルで、Qwen3-Coder-480B-A35B-Instruct のコーディングエージェント能力を継承しています。同規模でコード能力は SOTA に達しています。 |
テキスト生成、推論 | 2025-07-30 | グローバル |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、論理、数学、科学、コードなどの複雑な思考タスクに優れています。命令追従、テキスト理解、多言語翻訳能力が大幅に向上しました。 |
テキスト生成 | 2025-07-29 | グローバル |
| Qwen3 に基づくこのコード生成モデルは、Qwen3-Coder-Plus のコーディングエージェント能力を継承し、マルチターンのツールインタラクションをサポートします。リポジトリレベルの理解とツール呼び出しの安定性向上に重点を置いた最適化が特徴です。 |
テキスト生成 | 2025-07-29 | グローバル |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-30B-A3B) と比較して、中国語、英語、および全体的な多言語一般能力が大幅に向上しています。主観的な自由回答タスクに最適化されており、ユーザーの好みに著しく合致し、より役立つ応答を提供します。 |
テキスト生成、推論 | 2025-07-29 | グローバル |
| Qwen3 シリーズ Plus モデルは、思考モードと非思考モードを統合し、対話中にモードを切り替えることができます。以前のバージョンと比較して、中国語と英語の能力およびツール呼び出しに特化した機能強化が追加されています。これは 2025 年 7 月 28 日のスナップショットで、初めて 1M のコンテキスト長をサポートし、段階的価格設定を使用します。 |
テキスト生成、推論 | 2025-07-25 | グローバル |
| オープンソースの Qwen3 思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、論理能力、一般能力、知識強化、創造性が大幅に向上しており、高難易度で強力な思考を要するシナリオに適しています。 |
テキスト生成 | 2025-07-24 | グローバル |
| Qwen シリーズのフラッグシップ翻訳モデルである Qwen-MT-Plus は、Qwen3 アーキテクチャで完全にアップグレードされました。92 の言語をサポートし、非常に正確で自然な響きの翻訳を提供します。コンテキスト理解、用語制御、フォーマット保持における高度な能力により、特に専門分野において従来のモデルよりも優れた選択肢となります。 |
テキスト生成 | 2025-07-23 | グローバル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデルで、ツール呼び出しと環境インタラクションに優れ、優れたコード能力を維持しながら自律的なプログラミングが可能です。 |
テキスト生成 | 2025-07-23 | グローバル |
| 強力なコーディングエージェント能力を持つ Qwen3 ベースのコード生成モデル。コード能力はオープンソースの SOTA に達しています。 |
テキスト生成 | 2025-07-23 | グローバル |
| オープンソースの Qwen3 非思考モデル。以前のバージョン (Qwen3-235B-A22B) と比較して、主観的な創造性とモデルの安全性にわずかな改善が見られます。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、同規模の業界で最先端 (SOTA) レベルに達し、一般能力は Qwen2.5-7B を大幅に上回ります。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-32B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は、より小さなパラメーターサイズで QwQ-32B に匹敵し、一般能力は Qwen2.5-14B を大幅に上回り、同規模の業界で最先端 (SOTA) レベルに達しています。 |
テキスト生成、推論 | 2025-05-12 | グローバル |
| 思考モードと非思考モードの効果的な統合を実現し、会話中にモードを切り替えることができます。その推論能力は QwQ を大幅に上回り、一般能力は Qwen2.5-72B-Instruct を著しく超え、同規模の業界で最先端 (SOTA) レベルに達しています。 |
日本 (東京)
モデルタイプ | 日付 | サービス範囲 | モデル ID | 説明 |
|---|---|---|---|---|
テキスト生成、推論、視覚理解 | 2026-09-02 | インターナショナル |
| Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) is an upgraded snapshot of qwen3.8-max. Coding capability breaks new ground, handling more complex engineering-scale projects and long-horizon autonomous development. Collaborative agent performance is significantly enhanced, with greater composure in multi-tool orchestration and end-to-end task delivery. Native vision understanding is refined across chart reasoning, document parsing, and multimodal perception — sharper and more reliable. Retains the 1M context window, thinking mode, and full tool ecosystem, evolving at a higher level of intelligence. |
テキスト生成、深い思考、視覚理解 | 2026-08-26 | インターナショナル |
| Qwen3.8-Flash は千問3.8シリーズの軽量フラッグシップモデルで、100万トークンのコンテキストウィンドウ、最大128kの出力長、256kの思考バジェットをサポートします。深い推論、Function Calling、構造化出力、組み込みツール、ネイティブ視覚理解に対応し、性能とコストの最適なバランスを実現します。日常的なテキスト生成からエージェントシナリオまで幅広いタスクに適しています。 |
動画生成 | 2026-08-20 | グローバル |
| Wan3.0-Video-Prime は、Wan3.0 動画生成モデルの高速バージョンであり、その機能は Wan3.0-Video 標準バージョンに準拠しています。4 モーダル完全参照入力をサポートし、最大 30 秒の動画を生成でき、エンドツーエンドの速度が大幅に向上した没入感のある視聴覚体験を提供します。 |
テキスト生成、推論、視覚理解 | 2026-08-19 | グローバル |
| Kimi K3 は、2.8 兆のパラメーターを持つ Kimi の最も強力なフラッグシップモデルです。KDA ハイブリッド線形アテンション (Kimi Delta Attention) および Attention Residuals 技術に基づいて構築されており、ネイティブで視覚理解をサポートし、100 万トークンのコンテキストウィンドウを備えています。これは、ロングコンテキストプログラミング、ナレッジワーク、および高度な推論のために設計された、世界初のオープンソース 3 兆パラメーターモデルです。 |
テキスト生成、推論 | 2026-08-14 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ Mixture-of-Experts (MoE) 大規模言語モデルです。ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。広範な高品質データでトレーニングされたこのモデルは、数学的・論理的推論、複雑な推論、プロフェッショナルなコード生成、詳細な長文ドキュメント分析において強力なパフォーマンスを発揮し、先端科学研究、複雑な企業ワークフロー、高度なエージェントアプリケーションなどの要求の厳しいシナリオに適しています。 |
動画生成 | 2026-08-06 | グローバル |
| Wan3.0 は、参照、編集、複製、駆動などの複数の創造的機能を統一的にサポートするオールインワン動画生成モデルです。4 モーダル完全参照入力、最大 30 秒の動画生成をサポートし、ファイル、Web ページ、複雑な画像を解析できます。プロダクションレベルのキャラクター一貫性とリアルな音声と映像により、没入感のある視聴覚的インパクトを提供します。 |
画像生成 | 2026-08-06 | グローバル |
| 豊富なコンテンツ:最大 4.5k トークンの入力と、画像内画像による高密度な情報レイアウトをサポートし、新聞、絵コンテ、メニュー、試験問題などの複雑なレイアウトを一度に生成できます。 本物のディテール:10px の小さなテキストの正確なレンダリングをサポートし、微細な表情、毛穴、髪の毛一本一本などの細かいディテールを鮮やかに再現し、実際の写真の品質に近づきます。 深い知識:12 言語と 20 以上のフォントのネイティブレンダリング、Web ページ、ゲーム、ライブストリームなどの主流インターフェイスのリアルなシミュレーションをサポートし、外部知識を完全に組み込みます。 Qwen-Image-3.0-Pro は「見栄えの良さ」だけでなく、「実用性」も追求しており、画像生成を真に展開可能な生産性ツールにしています。 |
画像生成 | 2026-08-04 | グローバル |
| 明確な命令理解:最大 4.5k トークンの入力をサポートし、複雑な画像テキスト命令を一度に生成します。安定したテキストレンダリング:10px の小さなテキスト、12 言語、20 以上のフォントが鮮明に読み取れ、インフォグラフィックやインターフェイスにすぐに使用できます。便利なバッチ出力:ポスター、Web ページ、インターフェイスなどの日常的なタスクを低コストで一括生成でき、継続的な作成に最適です。Qwen-Image-3.0 Standard は、生成品質だけでなく、日常の創造的な利便性も追求し、画像生成を持続可能なコンテンツ生産性ツールにします。 |
テキスト生成、推論、視覚理解 | 2026-08-02 | グローバル |
| 2.4 兆パラメーターの MoE フラッグシップで、コーディングとオフィス能力が包括的に飛躍し、数日間にわたって自律的にコーディングして完全なプロジェクトを提供できます。法律、金融、デザインなどの数百の専門的なタスクを処理し、1 回の対話でエンドツーエンドのプロダクションレベルの結果を提供します。ネイティブの視覚理解は、計画、実行、検証のパイプライン全体を通じて実行され、超長文ドキュメントと長尺動画の深層セマンティック解析をサポートします。長期タスクにおいて自律的計画とクローズドループ反復を実行し、継続的に進化します。 |
テキスト生成、推論 | 2026-08-01 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-07-28 | グローバル |
| kimi-k2.7-code は、Kimi のこれまでで最もインテリジェントなコーディングモデルです。ロングコンテキストでより確実に命令に従い、より高い成功率でプログラミングタスクを完了します。テキスト、画像、動画の入力をサポートし、思考モード、会話、エージェントタスクにも対応しています。 |
テキスト生成、推論 | 2026-07-28 | グローバル |
| GLM-5.2 は、Zhipu AI の最新のフラッグシップモデルで、超長 1M コンテキストウィンドウをサポートする長期タスク向けに設計されています。強力な論理的推論、長文理解、コード生成能力を備え、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れており、インテリジェントなインタラクション、エンタープライズアプリケーション、開発支援シナリオに適しています。 |
テキスト生成、推論、視覚理解 | 2026-07-21 | グローバル |
| Qwen3.7 ネイティブ視覚言語シリーズ Flash モデルは、3.6-Flash と比較してマルチモーダル理解とエージェント実行能力を包括的に強化しています。主な改善点には、基礎的なマルチモーダル能力の強化、オブジェクト認識の向上、実世界認識と空間的知性の改善が含まれます。Search Agent や CI Agent などのマルチモーダルエージェントシナリオは大幅にアップグレードされ、より安定したエンドツーエンドのタスク実行が可能になりました。マルチモーダルコーディング能力が最適化され、よりスムーズな Vibe コーディング体験を提供します。 |
テキスト生成 | 2026-07-02 | グローバル |
| Qwen シリーズのロールプレイングモデルです。これは動的に更新されるバージョンであり、モデルの更新については事前に通知が提供されます。擬人化ロールプレイングに適しており、事前定義されたキャラクターの指示に従う、会話を進める、積極的な傾聴と共感を示す能力が最適化されています。さらに、パーソナライズされたキャラクターの深い復元をサポートします。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-T2V は、セマンティック理解、映画的なショットコントロール、ダイナミックなモーションレンダリングが向上した Text-to-Video 生成をサポートします。創造的な意図をより正確に捉え、より滑らかな動き、豊かなディテール、強力な視覚的一貫性、そしてより自然なキャラクターのアクション、シーンの雰囲気、物理的なダイナミクスを持つ高品質な動画を生成します。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-R2V は、被写体、シーンスタイル、視覚的一貫性の安定性が大幅に向上した Reference-to-Video 生成をサポートします。最大 9 枚の参照画像をサポートし、創造的な意図をより正確に理解して保持し、キャラクター、シーン、スタイル、映画的な動き全体でより強力な制御性と表現力を提供します。 |
動画生成 | 2026-06-16 | グローバル |
| HappyHorse-1.1-I2V は、視覚品質、動的パフォーマンス、クリップ間の一貫性が向上した Image-to-Video 生成をサポートします。入力画像をより正確に理解し、創造的な意図を保持することで、肌の質感のリアリズム、クリップ間のキャラクター ID の一貫性、動きの滑らかさ、テキストレンダリングの安定性、視聴覚同期が大幅に改善され、より高いリアリズム、豊かなディテール、強力な全体的一貫性を持つ高品質な動画を生成します。 |
テキスト生成、推論、視覚理解 | 2026-06-01 | グローバル |
| Qwen3.7 シリーズの中で、コスト効率の高い Plus モデルは、堅牢なテキスト能力を基盤としながら、視覚言語能力を包括的にアップグレードし、コーディング、ツール使用、生産性ワークフローのためのフルスタックのエージェントレベルのインテリジェンスを維持しています。その主な特徴は、マルチモーダル対話型ハイブリッドエージェント機能であり、実世界のシーンを認識し、画面を読み取って GUI と対話し、視覚参照に基づいてコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを実行できます。 |
テキスト生成、推論 | 2026-05-21 | グローバル |
| Qwen3.7 シリーズで最大かつ最も高性能な Max モデルは、現在、公開実験用に純粋なテキストのみのインターフェイスを提供しています。Qwen3.7 は、エージェント中心の時代のために設計された次世代のフラッグシップモデルであり、その中核的な強みは、エージェントレベルの能力の幅広さと深さにあります。プログラミング、オフィスおよび生産性タスク、長期的な自律実行に優れています。 |
テキスト生成、推論 | 2026-05-11 | グローバル |
| 総パラメーター数 1.6 兆、アクティブ化パラメーター数 490 億のフラッグシップ MoE 大規模モデルで、ネイティブで最大 100 万トークンのコンテキスト長をサポートします。膨大な高品質データコーパスでトレーニングされており、高度な数学的推論、複雑な論理的推論、専門的なコーディング、長文テキストの詳細な分析に優れており、最先端の研究、洗練されたオフィスワークフロー、高度な AI エージェントなどの要求の厳しいアプリケーションに適しています。 |
テキスト生成、推論 | 2026-05-11 | グローバル |
| 総パラメーター数 2,840 億、アクティブ化パラメーター数 130 億の非常に効率的な軽量 MoE モデルで、ネイティブで最大 100 万トークンのコンテキストウィンドウをサポートします。高速な推論速度、低遅延、コスト効率の高い呼び出しを提供し、バランスの取れた全体的なパフォーマンスを実現します。高同時実行、軽量ワークロード向けに設計されており、日常対話、コンテンツ作成、基本的な RAG アプリケーション、バッチテキスト処理などの一般的で不可欠なユースケースに最適です。 |
テキスト生成、推論、視覚理解 | 2026-04-29 | グローバル |
| Kimi-k2.5 は、Moonshot AI の最も多機能なモデルで、ネイティブのマルチモーダルアーキテクチャを備え、視覚/テキスト入力、思考/非思考モード、および対話とエージェントタスクの両方をサポートします。 |
動画生成 | 2026-04-26 | グローバル |
| HappyHorse-1.0-V2V は、自然言語の命令による高度なビデオ編集をサポートします。最大 5 枚の参照画像を使用してビデオ要素の局所的または全体的な編集を可能にし、元の動きのダイナミクスを正確に保持して優れた表現力を実現します。 |
テキスト生成、推論、視覚理解 | 2026-04-17 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Flash モデルシリーズは、3.5-Flash バージョンに比べて大幅なパフォーマンス向上を実現しています。このモデルは特にエージェントコーディング能力に優れており、複数のコードエージェントベンチマークで前身を大幅に上回るだけでなく、数学的およびコード推論においても優れています。視覚面では、空間的知性が著しく向上しており、特にオブジェクトローカライゼーションとオブジェクト検出の強化が顕著です。 |
テキスト生成、推論 | 2026-04-14 | グローバル |
| GLM-5.1 は、Zhipu AI によって開発されたモデルで、長期タスク向けに特別に設計されています。7,440 億のパラメーターを持ち、20 万トークンの超長コンテキストをサポートし、1 回の応答で最大 12 万 8,000 トークンを生成できます。GLM-5.1 は、論理的推論、長文理解、コード生成に優れており、パフォーマンスと推論効率のバランスが取れています。複数のマルチタスクベンチマークで優れた結果を出し、インテリジェントなヒューマンコンピュータインタラクション、エンタープライズソリューション、開発者支援などのアプリケーションに適しています。 |
動画生成 | 2026-04-03 | グローバル |
| Wan2.7 動画編集は、プロンプトによる局所的および全体的な編集の両方をサポートします。画像参照を使用して要素をシームレスに置き換え、動き、特殊効果、カメラワークなどの複雑な動的プロセスを複製します。 |
動画生成 | 2026-04-03 | グローバル |
| Wan2.7 テキスト動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。 |
動画生成 | 2026-04-03 | グローバル |
| Wan2.7 参照動画生成、一貫性とパフォーマンスが向上しました。キャラクター、小道具、シーンの優れた安定性を提供します。最大 5 つの混合画像/動画入力のハイブリッド参照と音声の音色のクローンをサポートします。コアエンジンのアップグレードと合わせて、前例のない映画的な表現力を実現します。 |
動画生成 | 2026-04-03 | グローバル |
| Wan2.7 画像動画生成、パフォーマンスが完全に再考されました。物語の弧における繊細で有機的な感情の深さと、アクションシーケンスにおける内臓に響く骨を砕くようなインパクトを提供します。比類のないストーリーテリング能力のために、リズミカルな映画的カットで強化されています。 |
画像生成 | 2026-04-01 | グローバル |
| Wan2.7 – 画像生成および編集は、テキストから画像、テキスト/画像から連続画像、画像編集、複数画像参照生成、インタラクティブ編集をサポートします。テキストレンダリング、被写体の一貫性、複雑な命令追従において強化されたパフォーマンスを提供します。 |
テキスト生成、推論、視覚理解 | 2026-04-01 | グローバル |
| Qwen3.6 ネイティブ視覚言語 Plus シリーズモデルは、現在の最先端モデルに匹敵する卓越したパフォーマンスを示し、3.5 シリーズと比較して全体的な結果が大幅に向上しています。このモデルは、エージェントコーディング、フロントエンドプログラミング、Vibe コーディングなどのコード関連能力、およびマルチモーダル一般オブジェクト認識、OCR、オブジェクトローカライゼーションにおいて著しく強化されています。 |