音声会話、音声翻訳、または同時通訳のためのモデルを選択します。
クローズドソースモデルからの移行
現在お使いの OpenAI Realtime または Gemini Live のセットアップを、同等の Bailian モデルにマッピングします。
|
クローズドソースの例 |
Bailian の推奨 |
|
|
リアルタイム会話 |
OpenAI GPT Realtime、Gemini 3.1 Live |
|
|
コスト重視の会話 |
OpenAI gpt-4o-mini Realtime |
|
|
リアルタイム翻訳 |
Gemini 3.1 Live |
|
このページでは、音声対音声について説明します。視覚理解、音声/動画分析、またはコンテンツモデレーションについては、「オムニモーダル」のドキュメントをご参照ください。
S2S (音声対音声) とパイプラインの比較
音声アプリケーションを構築するには、2 つのアプローチがあります。
|
S2S |
パイプライン (ASR + LLM + TTS) |
|
|
レイテンシー |
低 -- 単一モデルのストリーム処理 |
高 -- 3段階のシリアル処理 |
|
音声理解 |
エンドツーエンド -- 声のトーンや感情を認識し、それに応じて応答します |
処理前にテキストに変換するため、音声の微妙なニュアンスが失われます |
|
音声のカスタマイズ |
システムプロンプトによるプリセット音声の選択 |
音声クローンと音声デザイン (CosyVoice) |
-
低レイテンシー、音声認識応答、インタラクティブな会話には S2S を使用します。
-
音声のカスタマイズが必要な場合や、ASR、LLM、TTS モデルを個別に選択したい場合は、パイプラインを使用します。
このページでは、S2S の単一モデルアプローチ (Omni および Livetranslate シリーズ) について説明します。パイプラインアプローチの場合は、各コンポーネントを個別に選択します。
リアルタイムモードとファイルモード
-
リアルタイム (WebSocket):音声アシスタント、コールセンター、同時通訳に使用します。音声入力と音声出力をストリーミングします。モデル名には
-realtimeが含まれます。 -
ファイルモード (HTTP):レイテンシーは高くなりますが、品質は向上します。動画の吹き替え、ポッドキャスト翻訳、オフライン処理に最適です。また、関数呼び出し、Web 検索、思考モード、動画コンテキストもサポートしています (下記のコンパニオン機能をご参照ください)。
ユースケース別モデル選択 (S2S 単一モデルアプローチ)
以下のすべてのユースケースでは、S2S 単一モデルアプローチを使用します。パイプラインアプローチの場合は、上記の ASR、LLM、TTS ガイドをご参照ください。
|
ユースケース |
推奨モデル |
API |
|
音声アシスタントとカスタマーサービス会話 |
|
WebSocket |
|
コスト重視の会話 |
|
WebSocket |
|
同時通訳とライブ翻訳 |
|
WebSocket |
|
動画の吹き替えとポッドキャスト翻訳 |
|
HTTP |
|
動画分析とバッチラベリング (思考モードが必要) |
|
HTTP |
|
セマンティック VAD 音声アシスタントとスマートカスタマーサービス (関数呼び出しをサポート) |
|
WebSocket |
S2S 単一モデルアプローチのコンパニオン機能
Qwen3.5-Omni と Qwen3-Omni は、これらの機能をネイティブに提供します。パイプラインを使用する場合、同等の機能は個々のコンポーネント (通常は LLM) から提供されます。
関数呼び出し
モデルは、見聞きした内容に基づいて、ナレッジベースのクエリ、スケジュールの確認、ワークフローのトリガーを実行できます。Qwen3.5-Omni (WebSocket または HTTP) または Qwen3-Omni (HTTP のみ) を使用します。
Qwen3.5-Omni/Qwen3-Omni リアルタイム (WebSocket) モデルまたは Livetranslate モデルではサポートされていません。Qwen-Audio Realtime (WebSocket) は関数呼び出しをサポートしています。
Web 検索
最新の出来事、株価、天気、および同様のクエリに関するリアルタイム情報を取得します。Qwen3.5-Omni (WebSocket または HTTP、Plus と Flash の両方) で利用できます。モデルは検索するかどうかを自律的に決定します。
Qwen3-Omni-Flash または Livetranslate モデルではサポートされていません。
思考モード
回答の品質がレイテンシーよりも重要な場合は、Qwen3-Omni (HTTP) を使用します。応答する前にステップバイステップで推論するため、動画分析やバッチラベリングに最適です。
思考モードでは音声生成はサポートされていません。
音声翻訳
以下のモデルシリーズが音声翻訳をサポートしています。
-
Qwen3.5-Livetranslate:60 言語 (うち 29 言語は音声+テキスト出力、31 言語はテキストのみ)。中国語、英語、フランス語、ドイツ語、ロシア語、日本語、韓国語、スペイン語、ポルトガル語、アラビア語などをカバーしています。
-
Qwen3-Livetranslate:18 言語と 5 つの中国語方言 (レイテンシー約 3 秒)。ファイルモードでは、コンテキストを意識した翻訳のために動画入力を受け付けます。7 言語はテキストのみの出力を生成します。
-
Qwen3.5-Omni:29 の出力言語と 8 つの中国語方言。強力な音声/動画理解と Web 検索。システムプロンプトを介して専門用語とドメインコンテキストを注入します。リアルタイムモードとファイルモードがあります。
-
Qwen3-Omni-Flash:11 の出力言語と 8 つの中国語方言。システムプロンプトを介して専門用語とドメインコンテキストを注入します。低コストでリアルタイムモードとファイルモードを利用できます。
クイックスタート:Livetranslate シリーズ。最高の品質と言語カバー率:Qwen3.5-Omni。コスト重視:Qwen3-Omni-Flash。
推奨モデル
この表には、各シリーズのエントリポイントモデルがリストされています。回帰テストや安定性のために日付付きバージョンを固定するには、以下の「すべてのモデル」をご参照ください。
|
モデル |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
翻訳 |
|
|
WebSocket |
音声、テキスト |
サポート |
-- |
-- |
-- |
|
|
WebSocket |
音声、テキスト |
サポート |
-- |
-- |
-- |
|
|
WebSocket |
テキスト、音声、画像 |
サポート |
サポート |
-- |
29 言語 |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
29 言語 |
|
|
WebSocket |
テキスト、音声、画像、動画 |
-- |
-- |
-- |
11 言語 |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
-- |
サポート |
11 言語 |
|
|
WebSocket |
音声、画像 |
-- |
-- |
-- |
60 言語 |
|
|
HTTP |
音声、動画 |
-- |
-- |
-- |
18 言語 |
すべてのモデル
Qwen3.5-Omni
|
モデル |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
|
|
WebSocket |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
WebSocket |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
WebSocket |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
WebSocket |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
サポート |
-- |
Qwen3-Omni
|
モデル |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
|
|
WebSocket |
テキスト、音声、画像、動画 |
-- |
-- |
-- |
|
|
WebSocket |
テキスト、音声、画像、動画 |
-- |
-- |
-- |
|
|
WebSocket |
テキスト、音声、画像、動画 |
-- |
-- |
-- |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
-- |
サポート |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
-- |
サポート |
|
|
HTTP |
テキスト、音声、画像、動画 |
サポート |
-- |
サポート |
Qwen3.5-Livetranslate
|
モデル |
API |
入力 |
言語 |
|
|
WebSocket |
音声 |
60 |
|
|
WebSocket |
音声 |
60 |
Qwen3-Livetranslate
|
モデル |
API |
入力 |
言語 |
|
|
WebSocket |
音声 |
18 |
|
|
WebSocket |
音声 |
18 |
|
|
HTTP |
音声、動画 |
18 |
|
|
HTTP |
音声、動画 |
18 |
Qwen-Audio
|
モデル |
API |
入力 |
関数呼び出し |
Web 検索 |
思考モード |
翻訳 |
|
|
WebSocket |
音声、テキスト |
サポート |
-- |
-- |
-- |
|
|
WebSocket |
音声、テキスト |
サポート |
-- |
-- |
-- |
レガシーモデル
これらのモデルは更新されなくなりました。新しいプロジェクトでは、Qwen3.5-Omni を使用してください。
|
モデル |
入力 |
API |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声、画像、動画 |
HTTP |
|
|
テキスト、音声 |
WebSocket |
|
|
テキスト、音声 |
WebSocket |
|
|
テキスト、音声 |
WebSocket |
次のステップ
モデルシリーズ別の API ドキュメント:
-
Qwen3.5-Omni および Qwen3-Omni (WebSocket、リアルタイム): Qwen-Omni-Realtime
-
Qwen3.5-Omni および Qwen3-Omni (HTTP、ファイル): 非リアルタイム (Qwen-Omni)
-
Qwen3.5-Livetranslate (WebSocket、リアルタイム): リアルタイム音声・動画翻訳 - Qwen
-
Qwen3-Livetranslate (HTTP、ファイル): 音声・動画ファイル翻訳 (Qwen)
-
Qwen-Audio Realtime (WebSocket、リアルタイム音声会話): リアルタイム音声チャット (Qwen-Audio-Realtime)