リアルタイム音声認識、音声ファイルの文字起こしなど、さまざまな音声テキスト変換のシナリオに適したモデルを選択します。
リアルタイムか非リアルタイムか
リアルタイム認識は、話者が話している最中に結果を出力します。非リアルタイム認識は、録音が完了した後に音声を文字起こしします。
リアルタイム(リアルタイム音声認識):WebSocket プロトコルを使用して、音声入力をストリーミングし、テキスト出力をストリーミングします。ライブ字幕、音声アシスタント、会議の文字起こしなどに適しています。
fun-asr-realtime(ホットワード、方言対応)またはqwen3.5-omni-plus-realtime(プロンプトコンテキスト、多言語対応)をご利用ください。非リアルタイム(音声ファイルの文字起こし):HTTP プロトコルを使用して音声ファイルを送信し、文字起こし結果を取得します。コンタクトセンターの録音、ポッドキャスト、インタビューなどに適しています。
fun-asr(ホットワード、話者分離)またはqwen3.5-omni-plus(プロンプトコンテキスト、多言語対応)をご利用ください。
Fun-ASR および Qwen3-ASR のリアルタイムモデルは、DashScope SDK(Java、Python)をサポートしています。 その他のモデルは、それぞれのプロトコルに基づき、直接 WebSocket または HTTP 呼び出しを行う必要があります。
リアルタイムでのご利用については、「リアルタイム音声認識」をご参照ください。非リアルタイムでのご利用については、「音声ファイルの文字起こし」をご参照ください。
ドメイン固有の用語の処理
以下の 2 つのアプローチが利用可能で、柔軟性の高い順に記載されています。
プロンプトコンテキストの注入:システムプロンプトでドメインを記述します。事前の構成は不要で、各リクエストごとにモデルが適応します。ただし、専用 ASR モデルと比べてリクエストあたりの遅延が大きくなるというトレードオフがあります。
qwen3.5-omni-plus-realtime(リアルタイム)またはqwen3.5-omni-plus(非リアルタイム)をご利用ください。ホットワード(カスタム語彙):重み付きの語彙リストを提供します。頻繁に変更されない安定した用語に最適です。
fun-asr-realtime(リアルタイム)またはfun-asr(非リアルタイム)をご利用ください。
Qwen3.5-Omni は従来型の ASR エンジンではなく、音声を理解できる大規模言語モデルです。システムプロンプトを通じてコンテキストを注入することで、ホットワードリストなしにモデルが適応します。
話者分離
話者分離をサポートするのは、非リアルタイムの Fun-ASR モデル(fun-asr、fun-asr-mtl)のみです。「誰が何を言ったか」を識別する必要がある場合は、これらのモデルをご利用ください。
感情認識
Qwen3-ASR および Qwen3.5-Omni モデルは、文字起こしと同時に感情を認識できます。qwen3-asr-flash-realtime(リアルタイム)または qwen3-asr-flash-filetrans(非リアルタイム)をご利用ください。
推奨モデル
以下の表は、各シナリオに推奨されるモデルを示しています。詳細については、モデルギャラリーをご参照ください。
|
モデル |
モード |
API |
精度向上機能 |
感情認識 |
話者分離 |
サポート言語 |
最大音声持続時間/サイズ |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語、英語、日本語、および方言 |
無制限 |
|
|
非リアルタイム |
HTTP |
ホットワード |
|
|
多言語および方言 |
12 時間 / 2 GB |
|
|
リアルタイム |
WebSocket |
プロンプトコンテキスト |
|
|
多言語 |
2 時間 |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
プロンプトコンテキスト |
|
|
多言語 |
3 時間 / 2 GB |
すべてのモデル
Fun-ASR
|
モデル |
モード |
API |
精度向上機能 |
感情認識 |
話者分離 |
サポート言語 |
最大音声持続時間/サイズ |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語、英語、日本語、および方言 |
無制限 |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語、英語、日本語、および方言 |
無制限 |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語、英語、日本語、および方言 |
無制限 |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語、英語 |
無制限 |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語 |
無制限 |
|
|
リアルタイム |
WebSocket |
ホットワード |
|
|
中国語 |
無制限 |
|
|
非リアルタイム |
HTTP |
ホットワード |
|
|
多言語および方言 |
12 時間 / 2 GB |
|
|
非リアルタイム |
HTTP |
ホットワード |
|
|
多言語および方言 |
12 時間 / 2 GB |
|
|
非リアルタイム |
HTTP |
ホットワード |
|
|
中国語、英語 |
12 時間 / 2 GB |
|
|
非リアルタイム |
HTTP |
ホットワード |
|
|
多言語および方言 |
12 時間 / 2 GB |
|
|
非リアルタイム |
HTTP |
ホットワード |
|
|
多言語および方言 |
12 時間 / 2 GB |
Qwen3-ASR
|
モデル |
モード |
API |
精度向上機能 |
感情認識 |
話者分離 |
サポート言語 |
最大音声持続時間/サイズ |
|
|
リアルタイム |
WebSocket |
|
|
|
多言語および方言 |
無制限 |
|
|
リアルタイム |
WebSocket |
|
|
|
多言語および方言 |
無制限 |
|
|
リアルタイム |
WebSocket |
|
|
|
多言語および方言 |
無制限 |
|
|
非リアルタイム |
HTTP |
|
|
|
多言語および方言 |
12 時間 / 2 GB |
|
|
非リアルタイム |
HTTP |
|
|
|
多言語および方言 |
12 時間 / 2 GB |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
|
|
|
多言語および方言 |
5 分 / 10 MB |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
|
|
|
多言語および方言 |
5 分 / 10 MB |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
|
|
|
多言語および方言 |
5 分 / 10 MB |
Qwen3.5-Omni / Qwen3-Omni
|
モデル |
モード |
API |
精度向上機能 |
感情認識 |
話者分離 |
サポート言語 |
最大音声持続時間/サイズ |
|
|
リアルタイム |
WebSocket |
プロンプトコンテキスト |
|
|
多言語 |
2 時間 |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
プロンプトコンテキスト |
|
|
多言語 |
3 時間 / 2 GB |
|
|
リアルタイム |
WebSocket |
プロンプトコンテキスト |
|
|
多言語 |
2 時間 |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
プロンプトコンテキスト |
|
|
多言語 |
3 時間 / 2 GB |
|
|
リアルタイム |
WebSocket |
プロンプトコンテキスト |
|
|
多言語および方言 |
2 時間 |
|
|
非リアルタイム |
HTTP(OpenAI 互換) |
プロンプトコンテキスト |
|
|
多言語および方言 |
20 分 / 100 MB |
レガシモデル
以下はレガシ ASR モデルです。ワークロードが許す場合は、上記の推奨モデルへの移行を推奨します。
|
モデル |
API |
説明 |
|
|
WebSocket |
リアルタイム認識、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語対応 |
|
|
WebSocket |
リアルタイム認識、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語対応 |
|
|
WebSocket |
リアルタイム認識、8 kHz テレフォニー、中国語対応 |
|
|
WebSocket |
リアルタイム認識、8 kHz テレフォニー、中国語対応 |
|
|
HTTP |
話者分離付き音声ファイルの文字起こし、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語対応 |
|
|
HTTP |
音声ファイルの文字起こし、8 kHz テレフォニー、中国語対応 |
すべてのモデルは、WAV、MP3、AAC などの一般的な音声フォーマットをサポートしています。