音声対話、音声・動画分析、コンテンツモデレーション、音声翻訳、その他のオムニモーダルタスクに適したモデルを選択します。
クローズドソースモデルからの移行
現在ご利用の GPT または Gemini のオムニモーダル/リアルタイム機能を、同等の Bailian モデルにマッピングします。
クローズドソースモデルの例 | Bailian 推奨 | |
|---|---|---|
最高性能 | GPT-5.5, Gemini 3.1 Pro |
|
軽量・低コスト | GPT-5.4-mini, Gemini 3.1 Flash |
|
リアルタイム翻訳 | Gemini 3.1 Live |
|
ユースケース
オムニモーダルモデルは、テキスト、音声、画像、動画を同時に理解し、テキストと音声の両方を出力します。Qwen3.5-Omni (フラッグシップ)、Qwen3-Omni-Flash (軽量、低コスト、思考モード対応)、Qwen3.5-Livetranslate (翻訳特化) の 3 つのファミリーが利用可能です。ユースケースに応じて選択してください:
ユースケース | 推奨モデル | ユーザーガイド |
|---|---|---|
リアルタイム音声/動画対話:マイクとカメラを通じて AI と対話します (音声アシスタント、カスタマーサービスボット、ビジュアル Q&A、ライブストリーム分析) | Qwen3.5-Omni Realtime (WebSocket) | |
音声・動画分析:音声または動画ファイルをアップロードし、AI が生成するテキストまたは音声の応答を取得します (動画コンテンツモデレーション、会議の文字起こし、字幕生成) | Qwen3.5-Omni (HTTP) | |
軽量な音声・動画分析:アップロードされた音声または動画ファイルを低コストで分析します (単一入力は 150 秒まで)。テキストのみの出力で思考モードをサポートします | Qwen3-Omni-Flash (HTTP) | |
リアルタイム音声翻訳:約 3 秒のレイテンシーで同時通訳を行い、60 言語に対応します (ライブ通訳、多言語会議) | Qwen3.5-Livetranslate (WebSocket) | |
音声・動画ファイルの翻訳:音声または動画ファイルをアップロードし、ターゲット言語に翻訳します (動画の吹き替え、ポッドキャスト翻訳) | Qwen3-Livetranslate (HTTP) | |
音声クローン:参照音声クリップを提供すると、AI がその声で音声応答を生成します | Qwen3.5-Omni Plus / Flash (HTTP / WebSocket) | |
セマンティック VAD を用いたリアルタイム音声対話:エンドツーエンドの音声インタラクション、セマンティックなターン検出 (smart_turn)、意味のない発話は対話を中断させません。関数呼び出しをサポートします (音声アシスタント、スマートカスタマーサービス) | Qwen-Audio (WebSocket) |
- コンテンツ分析において、Qwen3.5-Omni はリクエストごとに最大 3 時間の音声と最大 1 時間の動画をサポートします。
- Qwen3-Omni-Flash (HTTP のみ) および Qwen-Audio Realtime (WebSocket) は関数呼び出しをサポートします。
- Web 検索をサポートするのは Qwen3.5-Omni (HTTP / WebSocket) のみです。Web 検索と関数呼び出しは同時に有効にすることはできません。
翻訳
複数のオムニモーダルモデルが音声翻訳をサポートしており、それぞれが異なるシナリオに適しています。
注記クイックセットアップ:Qwen3.5-Livetranslate (60 言語、約 3 秒のレイテンシー、すぐに利用可能)。最高品質:Qwen3.5-Omni (29 の出力言語、Web 検索、用語挿入に対応)。コスト重視:Qwen3-Omni-Flash (11 の出力言語、低コスト)。
対応言語
言語 | Qwen3.5-Livetranslate | Qwen3-Livetranslate | Qwen3.5-Omni | Qwen3-Omni-Flash |
|---|---|---|---|---|
英語 | 対応 | 対応 | 対応 | 対応 |
中国語 (標準語) | 対応 | 対応 | 対応 | 対応 |
広東語 | 対応 | 対応 | 対応 テキストのみ | 対応 |
四川語 | 対応 | 対応 | 対応 | 対応 |
上海語 | 対応 | 対応 | 対応 | 対応 |
北京語 | 対応 | 対応 | 対応 | 対応 |
天津人 | 対応 | 対応 | 対応 | 対応 |
南京語 | 非対応 テキストのみ | 非対応 | 対応 | 対応 |
陝西語 | 非対応 テキストのみ | 非対応 | 対応 | 対応 |
福建語 | 非対応 テキストのみ | 非対応 | 対応 | 対応 |
フランス語 | 対応 | 対応 | 対応 | 対応 |
ドイツ語 | 対応 | 対応 | 対応 | 対応 |
ロシア語 | 対応 | 対応 | 対応 | 対応 |
イタリア語 | 対応 | 対応 | 対応 | 対応 |
スペイン語 | 対応 | 対応 | 対応 | 対応 |
ポルトガル語 | 対応 | 対応 | 対応 | 対応 |
日本語 | 対応 | 対応 | 対応 | 対応 |
韓国語 | 対応 | 対応 | 対応 | 対応 |
タイ語 | 対応 | 対応 テキストのみ | 対応 | 対応 |
インドネシア語 | 対応 | 対応 テキストのみ | 対応 | 非対応 |
ベトナム語 | 対応 | 対応 テキストのみ | 対応 | 非対応 |
アラビア語 | 対応 | 対応 テキストのみ | 対応 | 非対応 |
ヒンディー語 | 対応 | 対応 テキストのみ | 対応 | 非対応 |
トルコ語 | 対応 | 対応 テキストのみ | 対応 | 非対応 |
フィンランド語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
ポーランド語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
オランダ語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
チェコ語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
ウルドゥー語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
タガログ語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
スウェーデン語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
デンマーク語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
ヘブライ語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
アイスランド語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
マレー語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
ノルウェー語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
ペルシャ語 | 非対応 テキストのみ | 非対応 | 対応 | 非対応 |
ギリシャ語 | 対応 テキストのみ | 対応 テキストのみ | 非対応 | 非対応 |
「対応」は音声とテキストの両方の出力を意味します。「テキストのみ」は音声なしのテキスト出力を意味します。
Qwen3.5-Livetranslate は合計 60 言語をサポートします。そのうち 29 言語は音声とテキストの両方で出力可能で、31 言語はテキストのみの出力となります。
Qwen3.5-Omni は 113 の入力言語と方言をサポートします。
レガシモデルの qwen-omni-turbo は中国語と英語のみをサポートします。
推奨モデル
モデル ID | API | 入力 | 関数呼び出し | Web 検索 | 思考モード |
|---|---|---|---|---|---|
| WebSocket | テキスト、音声、画像 | 対応 | 対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 非対応 | 対応 | 非対応 |
| WebSocket | テキスト、音声、画像 | 対応 | 対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 非対応 | 対応 | 非対応 |
| WebSocket | テキスト、音声、画像、動画 | 非対応 | 非対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 対応 | 非対応 | 対応 |
| WebSocket | 音声、画像 | 非対応 | 非対応 | 非対応 |
| HTTP | 音声、動画 | 非対応 | 非対応 | 非対応 |
| WebSocket | 音声、テキスト | 対応 | 非対応 | 非対応 |
| WebSocket | 音声、テキスト | 対応 | 非対応 | 非対応 |
すべてのモデル
Qwen3.5-Omni
モデル ID | API | 入力 | 関数呼び出し | Web 検索 | 思考モード |
|---|---|---|---|---|---|
| WebSocket | テキスト、音声、画像、動画 | 対応 | 対応 | 非対応 |
| WebSocket | テキスト、音声、画像、動画 | 対応 | 対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 非対応 | 対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 非対応 | 対応 | 非対応 |
| WebSocket | テキスト、音声、画像、動画 | 対応 | 対応 | 非対応 |
| WebSocket | テキスト、音声、画像、動画 | 対応 | 対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 非対応 | 対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 非対応 | 対応 | 非対応 |
Qwen3-Omni
モデル ID | API | 入力 | 関数呼び出し | Web 検索 | 思考モード |
|---|---|---|---|---|---|
| WebSocket | テキスト、音声、画像、動画 | 非対応 | 非対応 | 非対応 |
| WebSocket | テキスト、音声、画像、動画 | 非対応 | 非対応 | 非対応 |
| WebSocket | テキスト、音声、画像、動画 | 非対応 | 非対応 | 非対応 |
| HTTP | テキスト、音声、画像、動画 | 対応 | 非対応 | 対応 |
| HTTP | テキスト、音声、画像、動画 | 対応 | 非対応 | 対応 |
| HTTP | テキスト、音声、画像、動画 | 対応 | 非対応 | 対応 |
Qwen3.5-Livetranslate
モデル ID | API | 入力 | 言語 |
|---|---|---|---|
| WebSocket | 音声 | 60 |
| WebSocket | 音声 | 60 |
Qwen3-Livetranslate
モデル ID | API | 入力 | 言語 |
|---|---|---|---|
| WebSocket | 音声 | 18 |
| WebSocket | 音声 | 18 |
| HTTP | 音声、動画 | 18 |
| HTTP | 音声、動画 | 18 |
Qwen-Audio
モデル ID | API | 入力 | 関数呼び出し | Web 検索 | 思考モード |
|---|---|---|---|---|---|
| WebSocket | 音声、テキスト | 対応 | 非対応 | 非対応 |
| WebSocket | 音声、テキスト | 対応 | 非対応 | 非対応 |
レガシモデル
以下のモデルは更新されなくなりました。新規プロジェクトには Qwen3.5-Omni を使用してください。
モデル ID | 入力 | API |
|---|---|---|
| テキスト、音声、画像、動画 | HTTP |
| テキスト、音声、画像、動画 | HTTP |
| テキスト、音声、画像、動画 | HTTP |
| テキスト、音声、画像、動画 | HTTP |
| テキスト、音声 | WebSocket |
| テキスト、音声 | WebSocket |
| テキスト、音声 | WebSocket |