リアルタイムまたはファイルベースの音声認識に適したモデルを選択します。
クローズドソースモデルからの移行
現在ご利用の Whisper、Deepgram、または Google ASR サービスを、同等の Bailian サービスにマッピングします。
ユースケース | クローズドソースの例 | Bailian の推奨 |
|---|---|---|
リアルタイム認識 | Deepgram Nova-3, Google Chirp 3 |
|
オフライン / ファイル文字起こし | OpenAI gpt-4o-transcribe, Whisper |
|
「選択基準」 (リアルタイム vs オフライン、ドメイン専門用語、話者分離、感情認識) の 4 つの基準を使用して、適切なモデルを特定します。次に、「推奨モデル」でシナリオごとのおすすめモデルを、「すべてのモデル」でモデルファミリーごとの完全なバージョンリストを、「音声仕様」で入力制約を確認します。サポートされている言語 (方言を含む) は、「すべてのモデル」の各モデルファミリーの下にリストされています。
選択基準
4 つのディメンションを評価して、適切なモデルを見つけます。
リアルタイムまたはオフライン
リアルタイム認識は、ユーザーが話している間に結果を返します。オフライン認識は、録音が終了した後に、事前に録音されたファイルを文字起こしします。
- リアルタイム (ストリーミング認識): WebSocket 接続を使用して、音声を入力し、テキストを出力します。ライブキャプション、音声アシスタント、会議の文字起こしに最適です。推奨モデル:
qwen-audio-3.0-asr-flash-streaming(ホットワード、プロンプトコンテキスト、多言語 (方言対応))。 - オフライン (ファイル文字起こし): HTTP API を使用して音声ファイルを送信し、文字起こし結果を取得します。コールセンターの録音、ポッドキャスト、インタビューに適しています。推奨モデル:
qwen-audio-3.0-asr-flash-filetrans(ホットワード、プロンプトコンテキスト、話者分離)。
Qwen-Audio-3.0-ASR-Flash-Streaming および Fun-ASR-Realtime シリーズのモデルは、AOQ プロトコルもサポートしています。プロトコルの比較については、「リアルタイム API の概要」をご参照ください。
Qwen-Audio-3.0-ASR-Flash-Streaming、Qwen-Audio-3.0-ASR-Flash-Filetrans、および Fun-ASR と Qwen-ASR のリアルタイムモデルは、DashScope SDK (Java、Python) をサポートしています。 その他のすべてのモデルでは、直接的な WebSocket または HTTP API 呼び出しが必要です。
リアルタイム統合については、「リアルタイム音声認識」をご参照ください。オフライン統合については、「非リアルタイム音声認識」をご参照ください。
ドメイン専門用語
柔軟性の高い順に 2 つのアプローチがあります:
- プロンプトコンテキストインジェクション: システムプロンプトでドメインを記述します。セットアップは不要で、モデルはリクエストごとに適応します。推奨: Qwen-Audio-3.0-ASR-Flash-Streaming、Qwen-Audio-3.0-ASR-Flash-Filetrans、および Qwen-Audio-3.0-ASR-Flash シリーズ。
- ホットワード: 重み付けされた語彙リストを提供します。推奨: Qwen-Audio-3.0-ASR-Flash-Streaming、Qwen-Audio-3.0-ASR-Flash-Filetrans、および Qwen-Audio-3.0-ASR-Flash シリーズ。
話者分離
Qwen-Audio-3.0-ASR-Flash-Filetrans シリーズ (qwen-audio-3.0-asr-flash-filetrans) および Fun-ASR オフラインモデル (fun-asr および fun-asr-mtl) は話者分離をサポートしています。誰が何を言ったかを特定するには、qwen-audio-3.0-asr-flash-filetrans を使用します。
感情認識
Qwen-ASR モデルは、文字起こしと同時に感情を検出します。推奨モデル: qwen3-asr-flash-realtime (リアルタイム) または qwen3-asr-flash-filetrans (オフライン)。
推奨モデル
一般的なシナリオ向けの推奨モデルです。
モデル ID | モード | API | 精度向上 | 感情認識 | 話者分離 | 言語 | 最大音声時間/サイズ |
|---|---|---|---|---|---|---|---|
| リアルタイム | WebSocket | ホットワード、プロンプトコンテキスト | 非対応 | 非対応 | 多言語 (方言対応) | 無制限 |
| オフライン | HTTP | ホットワード、プロンプトコンテキスト | 非対応 | 対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
すべてのモデル
Qwen-Audio-3.0-ASR-Flash-Streaming
モデル ID | モード | API | 精度向上 | 感情認識 | 話者分離 | 最大音声時間/サイズ | |
|---|---|---|---|---|---|---|---|
| リアルタイム | WebSocket | ホットワード、プロンプトコンテキスト | 非対応 | 非対応 | 多言語 (方言対応) | 無制限 |
サポート言語 (バージョン別):
qwen-audio-3.0-asr-flash-streaming: 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語
Qwen-Audio-3.0-ASR-Flash-Filetrans
モデル ID | モード | API | 精度向上 | 感情認識 | 話者分離 | 最大音声時間/サイズ | |
|---|---|---|---|---|---|---|---|
| オフライン | HTTP | ホットワード、プロンプトコンテキスト | 非対応 | 対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
サポート言語 (バージョン別):
qwen-audio-3.0-asr-flash-filetrans: 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語
Qwen-Audio-3.0-ASR-Flash
モデル ID | モード | API | 精度向上 | 感情認識 | 話者分離 | 最大音声時間/サイズ | |
|---|---|---|---|---|---|---|---|
| オフライン | HTTP | ホットワード、プロンプトコンテキスト | 非対応 | 非対応 | 多言語 (方言対応) | 5 分 / 2 GB |
サポート言語 (バージョン別):
qwen-audio-3.0-asr-flash: 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語
Fun-ASR
モデル ID | モード | API | 精度向上 | 感情認識 | 話者分離 | 最大音声時間/サイズ | |
|---|---|---|---|---|---|---|---|
| リアルタイム | WebSocket | ホットワード | 非対応 | 非対応 | 中国語、英語、日本語、および方言 | 無制限 |
| リアルタイム | WebSocket | ホットワード | 非対応 | 非対応 | 中国語、英語、日本語、および方言 | 無制限 |
| リアルタイム | WebSocket | ホットワード | 非対応 | 非対応 | 中国語、英語、日本語、および方言 | 無制限 |
| リアルタイム | WebSocket | ホットワード | 非対応 | 非対応 | 中国語、英語 | 無制限 |
| リアルタイム | WebSocket | ホットワード | 非対応 | 非対応 | 中国語 | 無制限 |
| リアルタイム | WebSocket | ホットワード | 非対応 | 非対応 | 中国語 | 無制限 |
| オフライン | HTTP | ホットワード | 非対応 | 対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
| オフライン | HTTP | プロンプトコンテキスト | 非対応 | 非対応 | 多言語 (方言対応) | 5 分 / 2 GB |
| オフライン | HTTP | ホットワード | 非対応 | 対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
| オフライン | HTTP | ホットワード | 非対応 | 対応 | 中国語、英語 | 12 時間 / 2 GB |
| オフライン | HTTP | ホットワード | 非対応 | 対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
| オフライン | HTTP | ホットワード | 非対応 | 対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
サポート言語 (バージョン別):
- Fun-ASR-Realtime のメインバージョン (
fun-asr-realtime、fun-asr-realtime-2026-02-28、fun-asr-realtime-2025-11-07): 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語 fun-asr-realtime-2025-09-15: 中国語 (標準語)、英語- Fun-ASR-Flash-Realtime(8K) (
fun-asr-flash-8k-realtime、fun-asr-flash-8k-realtime-2026-01-28): 中国語 - Fun-ASR のメインバージョン (
fun-asr、fun-asr-2025-11-07): 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語 - Fun-ASR-Flash (
fun-asr-flash-2026-06-15): 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語 fun-asr-2025-08-25: 中国語 (標準語)、英語- Fun-ASR(MTL) (
fun-asr-mtl、fun-asr-mtl-2025-08-25): 中国語 (標準語、広東語)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語
Qwen-ASR
モデル ID | モード | API | 精度向上 | 感情認識 | 話者分離 | 最大音声時間/サイズ | |
|---|---|---|---|---|---|---|---|
| リアルタイム | WebSocket | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 無制限 |
| リアルタイム | WebSocket | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 無制限 |
| リアルタイム | WebSocket | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 無制限 |
| オフライン | HTTP | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
| オフライン | HTTP | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 12 時間 / 2 GB |
| オフライン | HTTP (OpenAI 互換) | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 5 分 / 10 MB |
| オフライン | HTTP (OpenAI 互換) | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 5 分 / 10 MB |
| オフライン | HTTP (OpenAI 互換) | 非対応 | 対応 | 非対応 | 多言語 (方言対応) | 5 分 / 10 MB |
サポート言語: すべての Qwen-ASR モデル (qwen3-asr-flash-realtime、qwen3-asr-flash-filetrans、qwen3-asr-flash、およびそれらのスナップショットバージョン) は同じ言語リストを共有します: 中国語 (標準語、四川語、閩南語、呉語、広東語)、英語、日本語、ドイツ語、韓国語、ロシア語、フランス語、ポルトガル語、アラビア語、イタリア語、スペイン語、ヒンディー語、インドネシア語、タイ語、トルコ語、ウクライナ語、ベトナム語、チェコ語、デンマーク語、フィリピン語、フィンランド語、アイスランド語、マレー語、ノルウェー語、ポーランド語、スウェーデン語。
Paraformer
Paraformer は旧世代の ASR モデルファミリーです。可能な場合は Fun-ASR または Qwen-ASR への移行を推奨します。
モデル ID | API | 説明 |
|---|---|---|
| WebSocket | リアルタイム認識。中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語 |
| WebSocket | リアルタイム認識。中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語 |
| WebSocket | 8 kHz テレフォニー向けのリアルタイム認識。中国語 |
| WebSocket | 8 kHz テレフォニー向けのリアルタイム認識。中国語 |
| HTTP | 話者分離付きファイル文字起こし。中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語 |
| HTTP | 8 kHz テレフォニー向けのファイル文字起こし。中国語 |
サポート言語 (バージョン別):
paraformer-realtime-v2、paraformer-v2: 中国語 (標準語、広東語、呉語、閩南語、東北、甘粛、貴州、河南、湖北、湖南、寧夏、山西、陝西、山東、四川、天津、江西、雲南、上海)、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語paraformer-realtime-v1、paraformer-realtime-8k-v2、paraformer-realtime-8k-v1、paraformer-8k-v2: 中国語 (標準語)
音声仕様
リアルタイムおよびオフラインモードの音声仕様です。サポートされている言語については、「すべてのモデル」のモデルファミリーのサブセクションをご参照ください。
リアルタイム
モデル ID | 入力メソッド | 音声フォーマット | サンプルレート | サイズ/時間 |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Streaming ( | バイナリストリーム |
| 任意 | 無制限 |
Fun-ASR-Realtime / Fun-ASR-MTL-Realtime ( | バイナリストリーム |
| 任意 | 無制限 |
Fun-ASR-Flash-8K-Realtime ( | バイナリストリーム | Fun-ASR-Realtime と同じ | 8 kHz | 無制限 |
Qwen-ASR-Realtime ( | バイナリストリーム |
| 8 kHz、16 kHz | 無制限 |
Paraformer-Realtime ( | バイナリストリーム | Fun-ASR-Realtime と同じ |
| 無制限 |
すべてのリアルタイムモデルは、モノラル (シングルチャンネル) 入力のみを受け付けます。
オフライン
モデル ID | 入力メソッド | 音声フォーマット | サンプルレート | ファイルサイズ/時間 |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Filetrans ( | 一般公開されているファイル URL。リクエストごとに 1 URL |
| 任意 | 2 GB 以下、12 時間以下 (話者分離を有効にする場合は 2 時間以下を推奨) |
Qwen-Audio-3.0-ASR-Flash ( | URL / Base64。リクエストごとに 1 ファイル |
| 任意 | 2 GB 以下、5 分以下 |
Fun-ASR ( | 一般公開されているファイル URL。リクエストごとに 1 URL |
| 任意 | 2 GB 以下、12 時間以下 (話者分離を有効にする場合は 2 時間以下を推奨) |
Fun-ASR-Flash ( | URL / Base64。リクエストごとに 1 ファイル |
| 任意 | 2 GB 以下、5 分以下 |
Paraformer ( | Fun-ASR と同じ | Fun-ASR と同じ | paraformer-v2 は任意レート、 | Fun-ASR と同じ |
Qwen3-ASR-Flash-Filetrans ( | 一般公開されているファイル URL。リクエストごとに 1 URL |
|
| 2 GB 以下、12 時間以下 |
Qwen3-ASR-Flash ( | URL / Base64 / ローカルファイルの絶対パス。リクエストごとに 1 ファイル |
|
| 10 MB 以下、5 分以下 |