音声対話、音声・動画分析、コンテンツモデレーション、音声翻訳、その他のオムニモーダルタスクに適したモデルを選択します。
クローズドソースモデルからの移行
現在ご利用の GPT または Gemini のオムニモーダル/リアルタイム機能を、同等の Bailian モデルにマッピングします。
|
クローズドソースモデルの例 |
Bailian 推奨 |
|
|
最高性能 |
GPT-5.5, Gemini 3.1 Pro |
|
|
軽量・低コスト |
GPT-5.4-mini, Gemini 3.1 Flash |
|
|
リアルタイム翻訳 |
Gemini 3.1 Live |
|
ユースケース
オムニモーダルモデルは、テキスト、音声、画像、動画を同時に理解し、テキストと音声の両方を出力します。Qwen3.5-Omni (フラッグシップ)、Qwen3-Omni-Flash (軽量、低コスト、思考モード対応)、Qwen3.5-Livetranslate (翻訳特化) の 3 つのファミリーが利用可能です。ユースケースに応じて選択してください:
|
ユースケース |
推奨モデル |
ユーザーガイド |
|
リアルタイム音声/動画対話:マイクとカメラを通じて AI と対話します (音声アシスタント、カスタマーサービスボット、ビジュアル Q&A、ライブストリーム分析) |
Qwen3.5-Omni Realtime (WebSocket) |
|
|
音声・動画分析:音声または動画ファイルをアップロードし、AI が生成するテキストまたは音声の応答を取得します (動画コンテンツモデレーション、会議の文字起こし、字幕生成) |
Qwen3.5-Omni (HTTP) |
|
|
軽量な音声・動画分析:アップロードされた音声または動画ファイルを低コストで分析します (単一入力は 150 秒まで)。テキストのみの出力で思考モードをサポートします |
Qwen3-Omni-Flash (HTTP) |
|
|
リアルタイム音声翻訳:約 3 秒のレイテンシーで同時通訳を行い、60 言語に対応します (ライブ通訳、多言語会議) |
Qwen3.5-Livetranslate (WebSocket) |
|
|
音声・動画ファイルの翻訳:音声または動画ファイルをアップロードし、ターゲット言語に翻訳します (動画の吹き替え、ポッドキャスト翻訳) |
Qwen3-Livetranslate (HTTP) |
|
|
音声クローン:参照音声クリップを提供すると、AI がその声で音声応答を生成します |
Qwen3.5-Omni Plus / Flash (HTTP / WebSocket) |
|
|
セマンティック VAD を用いたリアルタイム音声対話:エンドツーエンドの音声インタラクション、セマンティックなターン検出 (smart_turn)、意味のない発話は対話を中断させません。関数呼び出しをサポートします (音声アシスタント、スマートカスタマーサービス) |
Qwen-Audio (WebSocket) |
-
コンテンツ分析において、Qwen3.5-Omni はリクエストごとに最大 3 時間の音声と最大 1 時間の動画をサポートします。
-
Qwen3.5-Omni (WebSocket + HTTP)、Qwen3-Omni-Flash (HTTP のみ)、および Qwen-Audio Realtime (WebSocket) は関数呼び出しをサポートします。
-
Web 検索をサポートするのは Qwen3.5-Omni (HTTP / WebSocket) のみです。Web 検索と関数呼び出しは同時に有効にすることはできません。
翻訳
複数のオムニモーダルモデルが音声翻訳をサポートしており、それぞれが異なるシナリオに適しています。
クイックセットアップ:Qwen3.5-Livetranslate (60 言語、約 3 秒のレイテンシー、すぐに利用可能)。最高品質:Qwen3.5-Omni (29 の出力言語、Web 検索、用語挿入に対応)。コスト重視:Qwen3-Omni-Flash (11 の出力言語、低コスト)。
推奨モデル
|
モデル ID |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
|
|
WebSocket |
テキスト、音声、画像 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
音声、画像 |
|
|
|
|
|
HTTP |
音声、動画 |
|
|
|
|
|
WebSocket |
音声、テキスト |
|
|
|
|
|
WebSocket |
音声、テキスト |
|
|
|
すべてのモデル
Qwen3.5-Omni
|
モデル ID |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
Qwen3-Omni
|
モデル ID |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
WebSocket |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
|
|
HTTP |
テキスト、音声、画像、動画 |
|
|
|
Qwen3.5-Livetranslate
|
モデル ID |
API |
入力 |
言語 |
|
|
WebSocket |
音声 |
60 |
|
|
WebSocket |
音声 |
60 |
Qwen3-Livetranslate
|
モデル ID |
API |
入力 |
言語 |
|
|
WebSocket |
音声 |
18 |
|
|
WebSocket |
音声 |
18 |
|
|
HTTP |
音声、動画 |
18 |
|
|
HTTP |
音声、動画 |
18 |
Qwen-Audio
|
モデル ID |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
|
|
WebSocket |
音声、テキスト |
|
|
|
|
|
WebSocket |
音声、テキスト |
|
|
|
レガシモデル
以下のモデルは更新されなくなりました。新規プロジェクトには Qwen3.5-Omni を使用してください。
|
モデル ID |
入力 |
API |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声 |
WebSocket |
|
|
テキスト、音声 |
WebSocket |
|
|
テキスト、音声 |
WebSocket |